Validatie-rapportage
Vóór elke publicatieronde wordt een representatieve steekproef argumenten per onderwerp handmatig en door een tweede LLM (Gemini, onafhankelijk van het lokale extractiemodel) herbeoordeeld, zie "Transparantie & reproduceerbaarheid" op de Over-pagina. De resultaten (foutpercentage, systematische patronen per stage) komen hier per onderwerp te staan zodra die steekproefronde is afgerond.
Daarnaast draaien we het evalharnas (issue #62) periodiek tegen externe, publiek extern gelabelde referentiedatasets, om extractie- en tagkwaliteit onafhankelijk van onze eigen Kamerdebat-data te meten.
elecdebate60to16
- Argumentherkenning F1
- 45%
- Drogreden-tags F1
- 60%
50/318 sprekersbeurten gescoord, model qwen/qwen3.6-27b