Zo beoordelen we AI-antwoorden met CLEAR

Context. Limieten. Verwacht antwoord & resultaat.

CLEAR is het compacte raamwerk achter onze tests van antwoordkwaliteit. Dezelfde drie elementen helpen eerst een prompt te definiëren en daarna te beoordelen hoe goed het eerste antwoord eraan voldeed.

Eén raamwerk, twee taken

CLEAR is bewust compact. Het gebruikt dezelfde drie vragen bij het schrijven van een prompt en bij het beoordelen van het antwoord. Zo zijn de testcriteria zichtbaar voordat een model antwoordt, in plaats van achteraf een beoordelingssysteem te bedenken.

C — Context

Bij het prompten: Wat moet de AI weten? Bij het beoordelen: Heeft het antwoord de relevante context correct begrepen en gebruikt?

L — Limieten

Bij het prompten: Welke regels gelden? Bij het beoordelen: Heeft het antwoord de gevraagde regels, beperkingen en grenzen gerespecteerd?

EAR

Bij het prompten: Wat moet de AI precies teruggeven? Bij het beoordelen: Heeft het antwoord daadwerkelijk het verwachte antwoord en resultaat geleverd?

Waarom houden we het compact? Een score is alleen nuttig als lezers kunnen zien waarom die is gegeven. CLEAR houdt de dimensies breed genoeg om te onthouden, terwijl elke score nog steeds een concrete, zichtbare uitleg nodig heeft.

C — Context

Context vraagt of het antwoord de gegeven situatie begreep. Dat kan het doel van de gebruiker omvatten, de doelgroep, bronmateriaal, het kennisniveau, feiten die ongewijzigd moeten blijven of andere informatie die nodig is om de taak correct te beantwoorden.

Voorbeeld: Als een prompt vraagt om een uitleg voor een 15-jarige die nog nooit statistiek heeft gehad, moet een sterk antwoord het concept voor die doelgroep vereenvoudigen zonder het concept te vervangen door iets onnauwkeurigs.

Een hoge Context-score betekent niet dat elke feitelijke bewering in het antwoord onafhankelijk is geverifieerd. Het betekent dat het antwoord de voor die taak aangeleverde context correct heeft gebruikt.

L — Limieten

Limieten zijn de expliciete regels die het antwoord vormgeven. Waar mogelijk maken we ze objectief controleerbaar: aantal woorden, aantal bullets, aantal alinea’s, verplichte labels, een verplichte slotzin of een beperking zoals uitsluitend gratis bronnen gebruiken.

Eerst meten

Mechanische controles, zoals woordenaantallen en verplichte aantallen onderdelen, worden als feiten vastgelegd en niet op basis van uiterlijk geschat.

Daarna beoordelen

Beperkingen waarvoor een oordeel nodig is — bijvoorbeeld betekenis behouden of een gevraagde toon aanhouden — worden in de zichtbare beoordeling uitgelegd.

Belangrijk: Perfecte naleving van het formaat betekent niet automatisch een resultaat van hoge kwaliteit. Een antwoord kan 10/10 scoren voor Limieten en toch punten verliezen bij Verwacht antwoord & resultaat als het de betekenis verandert of de werkelijke taak mist.

EAR — Verwacht antwoord & resultaat

EAR stelt de meest praktische vraag: gaf het antwoord de gebruiker daadwerkelijk wat die nodig had? Hier beoordelen we volledigheid, bruikbaarheid, behoud van betekenis en of het resultaat geschikt is voor het gevraagde doel.

Goed formaat, zwak resultaat

Een antwoord kan onder de woordlimiet blijven en de juiste labels gebruiken, maar toch een belangrijke afhankelijkheid weglaten, de mate van zekerheid veranderen of iets opleveren dat niet klaar is voor het beoogde gebruik.

Sterk resultaat

Het antwoord vervult de taak als geheel: het gebruikt de relevante context, respecteert de regels en behoudt de betekenis en praktische uitkomst waar de gebruiker om vroeg.

E-mailvoorbeeld: In onze e-mailherschrijftestkan een professionele e-mail elk vereist feit behouden en toch onvolledig aanvoelen als een normale afsluiting ontbreekt. Dat is niet per se een fout bij Limieten wanneer de prompt zo’n afsluiting niet expliciet vereiste, maar het kan EAR wel beïnvloeden.

Hoe een CLEAR-score tot stand komt

Elke test van antwoordkwaliteit volgt dezelfde basisvolgorde. Het doel is herhaalbaarheid en transparantie, niet de bewering dat één handmatige run een wetenschappelijke benchmark is.

1
Leg de exacte prompt vast
Voor elke assistent in die test wordt exact dezelfde prompttekst gebruikt.
2
Leg het eerste volledige antwoord vast
Nieuwe chat, geen regeneratie en geen vervolgprompt. Het originele screenshot wordt als bewijs bewaard.
3
Leg de zichtbare omstandigheden vast
Datum, weergegeven model, account, web-/zoekstatus en andere relevante instellingen worden gedocumenteerd.
4
Controleer meetbare limieten
Woordenaantallen, aantallen bullets, labels en andere objectieve beperkingen worden rechtstreeks gecontroleerd.
5
Beoordeel C, L en EAR afzonderlijk
Elke score krijgt een zichtbare reden. We verbergen de onderbouwing niet achter een totaalscore.

De schaal van 1–10

1–3

Zwak: aan de vereiste is grotendeels niet voldaan.

4–6

Gedeeltelijk: belangrijke tekortkomingen blijven bestaan.

7–8

Goed: aan de vereiste is grotendeels voldaan, maar het probleem is betekenisvol genoeg om mee te wegen.

9

Zeer goed: bijna volledig voldaan, met slechts een klein probleem.

10

Volledig voldaan: voor deze dimensie is geen betekenisvol probleem gevonden.

N/A

Wordt gebruikt wanneer een dimensie echt niet van toepassing is. We veranderen “niet van toepassing” niet kunstmatig in 10/10.

Waarom geen totaalscore of winnaar? Door C, L en EAR gescheiden te houden, zijn fouten makkelijker te zien. Een perfecte formaatscore mag een wezenlijke betekenisverandering niet wegmiddelen.

Een echt voorbeeld: perfect formaat, veranderde betekenis

In Test 5werden vier assistenten gevraagd een projectnotitie voor een manager samen te vatten. In de bron stond dat het website-redesign “is planned for launch on 12 September.” ChatGPT vatte dat samen als “Website redesign launches 12 September.”

Waarom dit belangrijk is: de datum bleef behouden, maar de status niet. “Planned for launch” is voorwaardelijke projectinformatie; “launches” presenteert de gebeurtenis als zeker. In een managementsamenvatting kan dat beslissingen, deadlines en verwachtingen op basis van de projectstatus wezenlijk veranderen.

Context 10/10

Het antwoord begreep dat de taak een beknopte managementsamenvatting was en behield de relevante projectonderwerpen.

Limieten 10/10

Het bleef binnen 75 woorden, gebruikte precies drie bullets en gebruikte Status:, Risk: en Next action: zoals gevraagd.

EAR 5/10

Het resultaat is beknopt en correct geformatteerd, maar verandert een geplande lancering in een zekere lancering. In een samenvatting voor een manager verandert dat beslissingsrelevante projectstatus en kan het de planning wezenlijk misleiden.

Dit is waarom CLEAR Limieten en EAR van elkaar scheidt: het antwoord kan elke zichtbare formaatregel volgen en toch een inhoudelijk kwaliteitsprobleem hebben.

Wat CLEAR doet — en wat het niet beweert

CLEAR is ontworpen om zichtbaar te maken

Of een antwoord de taak begreep, de gevraagde limieten volgde en het verwachte resultaat leverde — met een zichtbare reden voor elke score.

CLEAR is niet ontworpen om te bewijzen

Dat elke feitelijke bewering waar is, dat één assistent in het algemeen “de beste” is of dat één handmatige run een wetenschappelijke benchmark van een model vormt.

Wanneer feitelijke verificatie belangrijk is, kunnen bronnen of beweringen afzonderlijk worden gecontroleerd en als bewijs worden gedocumenteerd. CLEAR zelf blijft gericht op antwoordkwaliteit ten opzichte van de prompt die daadwerkelijk is getest.

Bekijk CLEAR toegepast op echte antwoorden

Open de tests van antwoordkwaliteit om 24 handmatig vastgelegde antwoorden te vergelijken voor vijf praktische prompts en één ethische bonus.

Deel deze CLEAR-gids

PromptingEasy aan je scherm toevoegen

Gebruik het menu van je browser en kies de optie om deze site te installeren of aan je beginscherm toe te voegen.