← validatie-rapportage

Validatie: elecdebate60to16

Cumulatief 50 van 318 sprekersbeurten gescoord, model qwen/qwen3.6-27b(0 extractiefouten, 0 tagfouten totaal). Laatst bijgewerkt: 12 aug 2026, 11:04. Elke make validate-run scoort de eerstvolgende, nog niet gescoorde beurten en telt op bij deze cijfers. Zie docs/eval-elecdebate.md in de repository voor de volledige methodologie.

Argumentherkenning

Vindt onze extractie dezelfde tekstspannen als de dataset (standpunt + onderbouwing)?

Precision
36%
Recall
61%
F1
45%

Per teken van het citaat vergeleken, niet per heel argument: zo telt een net iets andere zinsgrens (politieke transcripten lopen niet exact gelijk met de dataset-labels) als gedeeltelijke overlap in plaats van een volledige misser. 11208 overlappende, 20290 te veel, 7266 gemiste tekens; dit zijn dus geen argumenttellingen.

Drogreden-tags

Kent onze tagprompt de juiste drogreden toe op de referentiecitaten van de dataset?

Precision
79%
Recall
48%
F1
60%

15 correct, 4 onterecht, 16 gemist, per drogreden-citaat geteld.

Argumentherkenning: voorbeelden

Verwacht/voorspeld staat er alleen bij als dit argument overlapt met een referentie-drogreden-citaat (zie "Drogreden-tags" hieronder) -- de meeste argumenten zijn geen drogreden en tonen dus geen tags.

Gevonden (90)
Gemist (50)
Onterecht herkend als argument (fout-positief) (27)

Drogreden-tags: voorbeelden

Correct (15)
Gemist (16)
Onterecht toegekend (3)

Beperkingen van de referentiedataset

Haddadan et al. (2018) hebben honderden minuten aan presidentiële debatten met de hand doorgelabeld op claims, premissen en hun onderlinge relaties, precies dat handwerk maakt onafhankelijke validatie tegen een externe bron zoals hier pas mogelijk.

Niet elke score-afwijking hierboven is dan ook een fout van onze pipeline. Twee voorbeelden uit de "Onterecht herkend als argument"-lijst:

Dat zijn precies de grensgevallen die je verwacht bij handmatige annotatie op deze schaal, ziedocs/eval-elecdebate.md voor de volledige toelichting.