Ein Modell, zwei Aufgaben
CLEAR ist bewusst kompakt. Beim Schreiben eines Prompts und bei der Bewertung der Antwort werden dieselben drei Fragen verwendet. Dadurch sind die Testkriterien bereits vor der Modellantwort sichtbar, statt im Nachhinein ein Bewertungssystem zu erfinden.
Beim Prompten: Was sollte die KI wissen? Bei der Bewertung: Hat die Antwort den relevanten Kontext korrekt verstanden und verwendet?
Beim Prompten: Welche Regeln gelten? Bei der Bewertung: Hat die Antwort die geforderten Regeln, Vorgaben und Grenzen eingehalten?
Beim Prompten: Was genau soll die KI ausgeben? Bei der Bewertung: Hat die Antwort tatsächlich die erwartete Antwort und das erwartete Ergebnis geliefert?
C — Kontext
Beim Kontext geht es darum, ob die Antwort die vorgegebene Situation verstanden hat. Dazu können das Ziel des Nutzers, die Zielgruppe, Quellenmaterial, Wissensstand, unverändert zu bewahrende Fakten oder andere Informationen gehören, die für eine korrekte Bearbeitung nötig sind.
Eine hohe Kontext-Bewertung bedeutet nicht, dass jede Tatsachenbehauptung der Antwort unabhängig verifiziert wurde. Sie bedeutet, dass die Antwort den für diese Aufgabe vorgegebenen Kontext korrekt genutzt hat.
L — Grenzen
Grenzen sind die ausdrücklichen Regeln, die die Antwort formen. Wo immer möglich, machen wir sie objektiv prüfbar: Wortzahl, Anzahl von Stichpunkten oder Absätzen, vorgeschriebene Bezeichnungen, ein geforderter Schlusssatz oder eine Vorgabe wie die ausschließliche Nutzung kostenloser Ressourcen.
Mechanische Prüfungen wie Wortzahlen und geforderte Anzahlen werden als Fakten erfasst und nicht nach optischem Eindruck geschätzt.
Vorgaben, die eine Beurteilung erfordern — etwa die Bedeutung zu bewahren oder einen gewünschten Ton einzuhalten — werden in der sichtbaren Bewertung erläutert.
EAR — Erwartete Antwort & Ergebnis
EAR stellt die praktischste Frage: Hat die Antwort dem Nutzer tatsächlich geliefert, was er brauchte? Hier bewerten wir Vollständigkeit, Nutzwert, Bedeutungstreue und ob das Ergebnis für den gewünschten Zweck geeignet ist.
Eine Antwort kann unter der Wortgrenze bleiben und die richtigen Bezeichnungen verwenden, aber trotzdem eine wichtige Abhängigkeit auslassen, den Grad der Gewissheit verändern oder ein Ergebnis liefern, das für den vorgesehenen Einsatz noch nicht geeignet ist.
Die Antwort erfüllt die Aufgabe als Ganzes: Sie nutzt den relevanten Kontext, hält die Regeln ein und bewahrt Bedeutung sowie praktisches Ergebnis, die der Nutzer verlangt hat.
So entsteht eine CLEAR-Bewertung
Jeder Test zur Antwortqualität folgt derselben Grundabfolge. Ziel sind Wiederholbarkeit und Transparenz — nicht die Behauptung, ein einzelner manueller Durchlauf sei ein wissenschaftlicher Benchmark.
Die Skala von 1–10
Schwach: die Anforderung wurde weitgehend verfehlt.
Teilweise: wesentliche Schwächen bleiben bestehen.
Gut: die Anforderung wurde weitgehend erfüllt, aber die Abweichung ist relevant genug, um ins Gewicht zu fallen.
Sehr gut: fast vollständig erfüllt, mit nur einer kleinen Schwäche.
Vollständig erfüllt: für diese Dimension wurde kein relevanter Mangel gefunden.
Wird verwendet, wenn eine Dimension tatsächlich nicht anwendbar ist. „Nicht anwendbar“ wird nicht künstlich zu 10/10 gemacht.
Ein echtes Beispiel: perfektes Format, veränderte Bedeutung
In Test 5 wurden vier Assistenten gebeten, eine Projektnotiz für eine Führungskraft zusammenzufassen. In der Quelle stand zum Website-Redesign „ist der Launch für den 12. September geplant.“ ChatGPT fasste dies so zusammen: „Website-Redesign startet am 12. September.“
Warum das wichtig ist: Das Datum blieb erhalten, der Status jedoch nicht. „Für den Launch geplant“ ist bedingte Projektinformation; „startet“ stellt das Ereignis als sicher dar. In einer Management-Zusammenfassung kann dies Entscheidungen, Fristen und Erwartungen auf Grundlage des Projektstatus wesentlich verändern.
Die Antwort verstand die Aufgabe als knappe Management-Zusammenfassung und behielt die relevanten Projektthemen bei.
Sie blieb unter 75 Wörtern, verwendete exakt drei Stichpunkte und nutzte Status:, Risk: und Next action: wie gefordert.
Das Ergebnis ist knapp und korrekt formatiert, macht aus einem geplanten Launch jedoch einen sicheren Launch. In einer Zusammenfassung für Führungskräfte verändert das entscheidungsrelevanten Projektstatus und kann die Planung erheblich irreführen.
Was CLEAR leistet — und was es nicht behauptet
ob eine Antwort die Aufgabe verstanden, die geforderten Grenzen eingehalten und das erwartete Ergebnis geliefert hat — mit sichtbarer Begründung für jede Bewertung.
dass jede Tatsachenbehauptung wahr ist, ein Assistent allgemein „der beste“ ist oder ein einzelner manueller Durchlauf einen wissenschaftlichen Benchmark eines Modells darstellt.
Wenn Faktenprüfung wichtig ist, können Quellen oder Behauptungen separat geprüft und als Nachweis dokumentiert werden. CLEAR selbst konzentriert sich auf die Antwortqualität im Verhältnis zu dem Prompt, der tatsächlich getestet wurde.