← over dit platform

Validatie-rapportage

Vóór elke publicatieronde wordt een representatieve steekproef argumenten per onderwerp handmatig en door een tweede LLM (Gemini, onafhankelijk van het lokale extractiemodel) herbeoordeeld, zie "Transparantie & reproduceerbaarheid" op de Over-pagina. De resultaten (foutpercentage, systematische patronen per stage) komen hier per onderwerp te staan zodra die steekproefronde is afgerond.

Daarnaast draaien we het evalharnas (issue #62) periodiek tegen externe, publiek extern gelabelde referentiedatasets, om extractie- en tagkwaliteit onafhankelijk van onze eigen Kamerdebat-data te meten.

elecdebate60to16

Argumentherkenning F1
45%
Drogreden-tags F1
60%

50/318 sprekersbeurten gescoord, model qwen/qwen3.6-27b