Jak testujemy odpowiedzi AI z CLEAR

Kontekst. Ograniczenia. Oczekiwany efekt. Odpowiedź. Rezultat.

CLEAR to zwięzła metoda stojąca za naszymi testami jakości odpowiedzi. Te same trzy obszary pomagają najpierw zdefiniować prompt, a potem ocenić, jak dobrze pierwsza odpowiedź spełniła jego wymagania.

Jedna metoda, dwa zastosowania

Metoda CLEAR jest celowo prosta. Podczas pisania promptu i podczas oceniania odpowiedzi wykorzystuje te same trzy pytania. Dzięki temu kryteria testu są widoczne jeszcze przed odpowiedzią modelu, zamiast być dopasowywane dopiero po fakcie.

C — Kontekst

Podczas tworzenia promptu: Co AI powinno wiedzieć? Podczas oceny: Czy odpowiedź poprawnie zrozumiała i wykorzystała istotny kontekst?

L — Ograniczenia

Podczas tworzenia promptu: Jakie zasady obowiązują? Podczas oceny: Czy odpowiedź przestrzegała wymaganych zasad, ograniczeń i granic?

EAR

Podczas tworzenia promptu: Co dokładnie AI ma zwrócić? Podczas oceny: Czy odpowiedź rzeczywiście dostarczyła oczekiwaną odpowiedź i rezultat?

Dlaczego tak zwięźle? Ocena jest użyteczna tylko wtedy, gdy czytelnik widzi, dlaczego została przyznana. CLEAR pozostawia wymiary na tyle szerokie, by łatwo je zapamiętać, ale każda ocena nadal wymaga konkretnego, widocznego uzasadnienia.

C — Kontekst

Kontekst sprawdza, czy odpowiedź zrozumiała przedstawioną sytuację. Może to obejmować cel użytkownika, odbiorców, materiał źródłowy, poziom wiedzy, fakty, które muszą pozostać niezmienione, oraz inne informacje potrzebne do prawidłowego wykonania zadania.

Przykład: Jeśli prompt prosi o wyjaśnienie dla 15-latka, który nigdy nie uczył się statystyki, dobra odpowiedź powinna uprościć pojęcie dla takiego odbiorcy, nie zastępując go jednak czymś niepoprawnym.

Wysoka ocena za Kontekst nie oznacza, że każde stwierdzenie faktyczne w odpowiedzi zostało niezależnie zweryfikowane. Oznacza, że odpowiedź prawidłowo wykorzystała kontekst podany dla tego zadania.

L — Ograniczenia

Ograniczenia to wyraźne zasady kształtujące odpowiedź. Gdy tylko jest to możliwe, formułujemy je tak, aby można je było obiektywnie sprawdzić: liczba słów, liczba punktów, liczba akapitów, wymagane etykiety, wymagane zdanie końcowe albo warunek, na przykład korzystanie wyłącznie z bezpłatnych zasobów.

Najpierw pomiar

Mechaniczne kontrole, takie jak liczba słów i wymagana liczba elementów, zapisujemy jako fakty, zamiast szacować je na podstawie wyglądu odpowiedzi.

Potem ocena

Ograniczenia wymagające oceny — na przykład zachowanie znaczenia albo utrzymanie żądanego tonu — są objaśniane w widocznym uzasadnieniu.

Ważne: Idealne spełnienie wymagań dotyczących formatu nie oznacza automatycznie wysokiej jakości rezultatu. Odpowiedź może otrzymać 10/10 za Ograniczenia, a mimo to stracić punkty za Oczekiwaną odpowiedź i rezultat, jeśli zmienia znaczenie albo nie wykonuje właściwego zadania.

EAR — Oczekiwana odpowiedź i rezultat

EAR zadaje najbardziej praktyczne pytanie: czy odpowiedź rzeczywiście dała użytkownikowi to, czego potrzebował? Tutaj oceniamy kompletność, użyteczność, zachowanie znaczenia oraz to, czy rezultat nadaje się do wskazanego celu.

Dobry format, słaby rezultat

Odpowiedź może zmieścić się w limicie słów i użyć właściwych etykiet, a mimo to pominąć ważną zależność, zmienić poziom pewności albo stworzyć rezultat, który nie jest gotowy do zamierzonego użycia.

Mocny rezultat

Odpowiedź realizuje zadanie jako całość: wykorzystuje istotny kontekst, przestrzega zasad oraz zachowuje znaczenie i praktyczny rezultat, o który prosił użytkownik.

Przykład e-maila: W naszym teście przepisywania e-maila profesjonalna wiadomość może zachować wszystkie wymagane fakty, a mimo to sprawiać wrażenie niepełnej, jeśli pomija zwyczajowe zakończenie. Nie musi to oznaczać naruszenia Ograniczeń, gdy prompt wyraźnie go nie wymagał, ale może wpłynąć na EAR.

Jak powstaje ocena CLEAR

Każdy test jakości odpowiedzi przebiega według tej samej podstawowej sekwencji. Celem jest powtarzalność i przejrzystość, a nie twierdzenie, że pojedynczy ręczny test stanowi naukowy benchmark.

1
Ustal dokładny prompt
W danym teście każdy asystent otrzymuje dokładnie ten sam tekst promptu.
2
Zapisz pierwszą pełną odpowiedź
Nowy czat, bez ponownego generowania i bez pytań uzupełniających. Oryginalny zrzut ekranu zachowujemy jako dowód.
3
Zapisz widoczne warunki
Dokumentujemy datę, wyświetlany model, konto, stan funkcji sieci/wyszukiwania oraz inne istotne ustawienia.
4
Sprawdź mierzalne ograniczenia
Liczbę słów, punktów, etykiet i inne obiektywne ograniczenia sprawdzamy bezpośrednio. Dla spójności liczba słów opiera się na widocznych tokenach rozdzielonych białymi znakami. Wliczamy nagłówki, etykiety, zwroty grzecznościowe, zakończenia wiadomości i uwagi dodane przez model; samego formatowania Markdown nie wliczamy.
5
Oceń C, L i EAR osobno
Każda ocena ma widoczne uzasadnienie. Przed przyznaniem 10/10 aktywnie ponownie sprawdzamy istotne daty, liczby, zależności, poziom pewności i znaczenie, zamiast uznawać „brak oczywistego problemu” za dowód idealnego wyniku.

Skala 1–10

1–3

Słabo: wymaganie w dużej mierze nie zostało spełnione.

4–6

Częściowo: nadal występują istotne braki.

7–8

Dobrze: wymaganie zostało w dużej mierze spełnione, ale pozostały problem jest na tyle istotny, że ma znaczenie.

9

Bardzo dobrze: wymaganie jest niemal w pełni spełnione, pozostał tylko drobny problem.

10

W pełni spełnione w tym teście: dla tego wymiaru nie znaleziono istotnego problemu.

N/D

Używane, gdy dany wymiar rzeczywiście nie ma zastosowania. Nie zamieniamy „nie dotyczy” w sztuczne 10/10.

Dlaczego nie ma jednej oceny zwycięzcy? Oddzielne C, L i EAR ułatwiają dostrzeżenie problemów. Idealna ocena za format nie powinna poprzez uśrednienie ukrywać istotnej zmiany znaczenia.

Rzeczywisty przykład: idealny format, zmienione znaczenie

W teście 2 czterech asystentów poproszono o podsumowanie notatki projektowej dla menedżera. Źródło mówiło, że przebudowana strona „is planned for launch on 12 September.” ChatGPT streścił to jako „Website redesign launches 12 September.”

Dlaczego to ma znaczenie: data została zachowana, ale status już nie. „Planned for launch” to warunkowa informacja projektowa; „launches” przedstawia wydarzenie jako pewne. W podsumowaniu dla menedżera taka zmiana może istotnie wpłynąć na decyzje, terminy i oczekiwania wynikające ze statusu projektu.

Kontekst 10/10

Odpowiedź zrozumiała, że zadaniem było zwięzłe podsumowanie dla menedżera, i zachowała istotne kwestie projektowe.

Ograniczenia 10/10

Odpowiedź zmieściła się w 75 słowach, użyła dokładnie trzech punktów oraz etykiet Status:, Risk: i Next action: zgodnie z poleceniem.

EAR 5/10

Rezultat jest zwięzły i poprawnie sformatowany, ale zamienia planowane uruchomienie w uruchomienie przedstawione jako pewne. W podsumowaniu dla menedżera zmienia to istotny dla decyzji status projektu i może realnie wprowadzać w błąd podczas planowania.

Dlatego CLEAR oddziela Ograniczenia od EAR: odpowiedź może spełnić wszystkie widoczne zasady formatowania, a mimo to mieć istotny problem jakościowy.

Co CLEAR pokazuje — i czego nie twierdzi

CLEAR ma pokazywać

Czy odpowiedź zrozumiała zadanie, przestrzegała wymaganych ograniczeń i dostarczyła oczekiwany rezultat — z widocznym uzasadnieniem każdej oceny.

CLEAR nie ma dowodzić

Że każde stwierdzenie faktyczne jest prawdziwe, że jeden asystent jest ogólnie „najlepszy” albo że pojedynczy ręczny test jest naukowym benchmarkiem modelu.

Gdy liczy się weryfikacja faktów, źródła lub stwierdzenia można sprawdzić osobno i udokumentować jako dowody. Sam CLEAR pozostaje skupiony na jakości odpowiedzi względem promptu, który rzeczywiście został przetestowany.

Zobacz CLEAR zastosowany do rzeczywistych odpowiedzi

Otwórz Testy jakości odpowiedzi, aby porównać 28 ręcznie zarejestrowanych odpowiedzi dla pięciu praktycznych promptów i dwóch testów bonusowych.

Udostępnij ten poradnik CLEAR

Dodaj PromptingEasy do ekranu

Otwórz menu przeglądarki i wybierz opcję instalacji tej witryny lub dodania jej do ekranu początkowego.