Jedna metoda, dwa zastosowania
Metoda CLEAR jest celowo prosta. Podczas pisania promptu i podczas oceniania odpowiedzi wykorzystuje te same trzy pytania. Dzięki temu kryteria testu są widoczne jeszcze przed odpowiedzią modelu, zamiast być dopasowywane dopiero po fakcie.
Podczas tworzenia promptu: Co AI powinno wiedzieć? Podczas oceny: Czy odpowiedź poprawnie zrozumiała i wykorzystała istotny kontekst?
Podczas tworzenia promptu: Jakie zasady obowiązują? Podczas oceny: Czy odpowiedź przestrzegała wymaganych zasad, ograniczeń i granic?
Podczas tworzenia promptu: Co dokładnie AI ma zwrócić? Podczas oceny: Czy odpowiedź rzeczywiście dostarczyła oczekiwaną odpowiedź i rezultat?
C — Kontekst
Kontekst sprawdza, czy odpowiedź zrozumiała przedstawioną sytuację. Może to obejmować cel użytkownika, odbiorców, materiał źródłowy, poziom wiedzy, fakty, które muszą pozostać niezmienione, oraz inne informacje potrzebne do prawidłowego wykonania zadania.
Wysoka ocena za Kontekst nie oznacza, że każde stwierdzenie faktyczne w odpowiedzi zostało niezależnie zweryfikowane. Oznacza, że odpowiedź prawidłowo wykorzystała kontekst podany dla tego zadania.
L — Ograniczenia
Ograniczenia to wyraźne zasady kształtujące odpowiedź. Gdy tylko jest to możliwe, formułujemy je tak, aby można je było obiektywnie sprawdzić: liczba słów, liczba punktów, liczba akapitów, wymagane etykiety, wymagane zdanie końcowe albo warunek, na przykład korzystanie wyłącznie z bezpłatnych zasobów.
Mechaniczne kontrole, takie jak liczba słów i wymagana liczba elementów, zapisujemy jako fakty, zamiast szacować je na podstawie wyglądu odpowiedzi.
Ograniczenia wymagające oceny — na przykład zachowanie znaczenia albo utrzymanie żądanego tonu — są objaśniane w widocznym uzasadnieniu.
EAR — Oczekiwana odpowiedź i rezultat
EAR zadaje najbardziej praktyczne pytanie: czy odpowiedź rzeczywiście dała użytkownikowi to, czego potrzebował? Tutaj oceniamy kompletność, użyteczność, zachowanie znaczenia oraz to, czy rezultat nadaje się do wskazanego celu.
Odpowiedź może zmieścić się w limicie słów i użyć właściwych etykiet, a mimo to pominąć ważną zależność, zmienić poziom pewności albo stworzyć rezultat, który nie jest gotowy do zamierzonego użycia.
Odpowiedź realizuje zadanie jako całość: wykorzystuje istotny kontekst, przestrzega zasad oraz zachowuje znaczenie i praktyczny rezultat, o który prosił użytkownik.
Jak powstaje ocena CLEAR
Każdy test jakości odpowiedzi przebiega według tej samej podstawowej sekwencji. Celem jest powtarzalność i przejrzystość, a nie twierdzenie, że pojedynczy ręczny test stanowi naukowy benchmark.
Skala 1–10
Słabo: wymaganie w dużej mierze nie zostało spełnione.
Częściowo: nadal występują istotne braki.
Dobrze: wymaganie zostało w dużej mierze spełnione, ale pozostały problem jest na tyle istotny, że ma znaczenie.
Bardzo dobrze: wymaganie jest niemal w pełni spełnione, pozostał tylko drobny problem.
W pełni spełnione w tym teście: dla tego wymiaru nie znaleziono istotnego problemu.
Używane, gdy dany wymiar rzeczywiście nie ma zastosowania. Nie zamieniamy „nie dotyczy” w sztuczne 10/10.
Rzeczywisty przykład: idealny format, zmienione znaczenie
W teście 2 czterech asystentów poproszono o podsumowanie notatki projektowej dla menedżera. Źródło mówiło, że przebudowana strona „is planned for launch on 12 September.” ChatGPT streścił to jako „Website redesign launches 12 September.”
Dlaczego to ma znaczenie: data została zachowana, ale status już nie. „Planned for launch” to warunkowa informacja projektowa; „launches” przedstawia wydarzenie jako pewne. W podsumowaniu dla menedżera taka zmiana może istotnie wpłynąć na decyzje, terminy i oczekiwania wynikające ze statusu projektu.
Odpowiedź zrozumiała, że zadaniem było zwięzłe podsumowanie dla menedżera, i zachowała istotne kwestie projektowe.
Odpowiedź zmieściła się w 75 słowach, użyła dokładnie trzech punktów oraz etykiet Status:, Risk: i Next action: zgodnie z poleceniem.
Rezultat jest zwięzły i poprawnie sformatowany, ale zamienia planowane uruchomienie w uruchomienie przedstawione jako pewne. W podsumowaniu dla menedżera zmienia to istotny dla decyzji status projektu i może realnie wprowadzać w błąd podczas planowania.
Co CLEAR pokazuje — i czego nie twierdzi
Czy odpowiedź zrozumiała zadanie, przestrzegała wymaganych ograniczeń i dostarczyła oczekiwany rezultat — z widocznym uzasadnieniem każdej oceny.
Że każde stwierdzenie faktyczne jest prawdziwe, że jeden asystent jest ogólnie „najlepszy” albo że pojedynczy ręczny test jest naukowym benchmarkiem modelu.
Gdy liczy się weryfikacja faktów, źródła lub stwierdzenia można sprawdzić osobno i udokumentować jako dowody. Sam CLEAR pozostaje skupiony na jakości odpowiedzi względem promptu, który rzeczywiście został przetestowany.