Eén raamwerk, twee taken
CLEAR is bewust compact. Het gebruikt dezelfde drie vragen bij het schrijven van een prompt en bij het beoordelen van het antwoord. Zo zijn de testcriteria zichtbaar voordat een model antwoordt, in plaats van achteraf een beoordelingssysteem te bedenken.
Bij het prompten: Wat moet de AI weten? Bij het beoordelen: Heeft het antwoord de relevante context correct begrepen en gebruikt?
Bij het prompten: Welke regels gelden? Bij het beoordelen: Heeft het antwoord de gevraagde regels, beperkingen en grenzen gerespecteerd?
Bij het prompten: Wat moet de AI precies teruggeven? Bij het beoordelen: Heeft het antwoord daadwerkelijk het verwachte antwoord en resultaat geleverd?
C — Context
Context vraagt of het antwoord de gegeven situatie begreep. Dat kan het doel van de gebruiker omvatten, de doelgroep, bronmateriaal, het kennisniveau, feiten die ongewijzigd moeten blijven of andere informatie die nodig is om de taak correct te beantwoorden.
Een hoge Context-score betekent niet dat elke feitelijke bewering in het antwoord onafhankelijk is geverifieerd. Het betekent dat het antwoord de voor die taak aangeleverde context correct heeft gebruikt.
L — Limieten
Limieten zijn de expliciete regels die het antwoord vormgeven. Waar mogelijk maken we ze objectief controleerbaar: aantal woorden, aantal bullets, aantal alinea’s, verplichte labels, een verplichte slotzin of een beperking zoals uitsluitend gratis bronnen gebruiken.
Mechanische controles, zoals woordenaantallen en verplichte aantallen onderdelen, worden als feiten vastgelegd en niet op basis van uiterlijk geschat.
Beperkingen waarvoor een oordeel nodig is — bijvoorbeeld betekenis behouden of een gevraagde toon aanhouden — worden in de zichtbare beoordeling uitgelegd.
EAR — Verwacht antwoord & resultaat
EAR stelt de meest praktische vraag: gaf het antwoord de gebruiker daadwerkelijk wat die nodig had? Hier beoordelen we volledigheid, bruikbaarheid, behoud van betekenis en of het resultaat geschikt is voor het gevraagde doel.
Een antwoord kan onder de woordlimiet blijven en de juiste labels gebruiken, maar toch een belangrijke afhankelijkheid weglaten, de mate van zekerheid veranderen of iets opleveren dat niet klaar is voor het beoogde gebruik.
Het antwoord vervult de taak als geheel: het gebruikt de relevante context, respecteert de regels en behoudt de betekenis en praktische uitkomst waar de gebruiker om vroeg.
Hoe een CLEAR-score tot stand komt
Elke test van antwoordkwaliteit volgt dezelfde basisvolgorde. Het doel is herhaalbaarheid en transparantie, niet de bewering dat één handmatige run een wetenschappelijke benchmark is.
De schaal van 1–10
Zwak: aan de vereiste is grotendeels niet voldaan.
Gedeeltelijk: belangrijke tekortkomingen blijven bestaan.
Goed: aan de vereiste is grotendeels voldaan, maar het probleem is betekenisvol genoeg om mee te wegen.
Zeer goed: bijna volledig voldaan, met slechts een klein probleem.
Volledig voldaan: voor deze dimensie is geen betekenisvol probleem gevonden.
Wordt gebruikt wanneer een dimensie echt niet van toepassing is. We veranderen “niet van toepassing” niet kunstmatig in 10/10.
Een echt voorbeeld: perfect formaat, veranderde betekenis
In Test 5werden vier assistenten gevraagd een projectnotitie voor een manager samen te vatten. In de bron stond dat het website-redesign “is planned for launch on 12 September.” ChatGPT vatte dat samen als “Website redesign launches 12 September.”
Waarom dit belangrijk is: de datum bleef behouden, maar de status niet. “Planned for launch” is voorwaardelijke projectinformatie; “launches” presenteert de gebeurtenis als zeker. In een managementsamenvatting kan dat beslissingen, deadlines en verwachtingen op basis van de projectstatus wezenlijk veranderen.
Het antwoord begreep dat de taak een beknopte managementsamenvatting was en behield de relevante projectonderwerpen.
Het bleef binnen 75 woorden, gebruikte precies drie bullets en gebruikte Status:, Risk: en Next action: zoals gevraagd.
Het resultaat is beknopt en correct geformatteerd, maar verandert een geplande lancering in een zekere lancering. In een samenvatting voor een manager verandert dat beslissingsrelevante projectstatus en kan het de planning wezenlijk misleiden.
Wat CLEAR doet — en wat het niet beweert
Of een antwoord de taak begreep, de gevraagde limieten volgde en het verwachte resultaat leverde — met een zichtbare reden voor elke score.
Dat elke feitelijke bewering waar is, dat één assistent in het algemeen “de beste” is of dat één handmatige run een wetenschappelijke benchmark van een model vormt.
Wanneer feitelijke verificatie belangrijk is, kunnen bronnen of beweringen afzonderlijk worden gecontroleerd en als bewijs worden gedocumenteerd. CLEAR zelf blijft gericht op antwoordkwaliteit ten opzichte van de prompt die daadwerkelijk is getest.