Tek çerçeve, iki görev
CLEAR bilinçli olarak küçük tutulmuştur. Prompt yazarken de yanıtı değerlendirirken de aynı üç soruyu kullanır. Böylece model yanıt vermeden önce test ölçütleri görünür olur; sonradan bir puanlama sistemi uydurulmaz.
Prompt yazarken: Yapay zekâ neyi bilmeli? Değerlendirirken: Yanıt, ilgili bağlamı doğru anlayıp kullandı mı?
Prompt yazarken: Hangi kurallar geçerli? Değerlendirirken: Yanıt, istenen kurallara, kısıtlara ve sınırlara uydu mu?
Prompt yazarken: Yapay zekâ tam olarak ne döndürmeli? Değerlendirirken: Yanıt gerçekten beklenen yanıtı ve sonucu sundu mu?
C — Bağlam
Bağlam, yanıtın kendisine verilen durumu anlayıp anlamadığını sorgular. Buna kullanıcının amacı, hedef kitlesi, kaynak materyali, bilgi düzeyi, değişmeden kalması gereken gerçekler veya görevi doğru yanıtlamak için gereken diğer bilgiler dahil olabilir.
Yüksek bir Bağlam puanı, yanıttaki her olgusal iddianın bağımsız olarak doğrulandığı anlamına gelmez. Yanıtın o görev için sağlanan bağlamı doğru kullandığı anlamına gelir.
L — Kısıtlar
Kısıtlar, yanıtın biçimini belirleyen açık kurallardır. Mümkün olduğunda bunları nesnel olarak kontrol edilebilir hale getiririz: kelime sayısı, madde işareti sayısı, paragraf sayısı, gerekli etiketler, zorunlu kapanış cümlesi veya yalnızca ücretsiz kaynakların kullanılması gibi bir kısıt.
Kelime sayısı ve gerekli öğe sayısı gibi mekanik kontroller, görünüşe bakılarak tahmin edilmez; olgu olarak kaydedilir.
Anlamı korumak veya istenen tonu sürdürmek gibi yorum gerektiren kısıtlar, görünür değerlendirmede açıklanır.
EAR — Beklenen Yanıt ve Sonuç
EAR en pratik soruyu sorar: Yanıt, kullanıcıya gerçekten ihtiyaç duyduğu şeyi verdi mi? Burada eksiksizliği, yararlılığı, anlamın korunmasını ve sonucun istenen amaca uygun olup olmadığını değerlendiririz.
Bir yanıt kelime sınırının altında kalıp doğru etiketleri kullanabilir; yine de önemli bir bağımlılığı atlayabilir, kesinlik düzeyini değiştirebilir veya amaçlanan kullanım için hazır olmayan bir şey üretebilir.
Yanıt görevi bir bütün olarak yerine getirir: ilgili bağlamı kullanır, kurallara uyar ve kullanıcının istediği anlamı ve pratik sonucu korur.
CLEAR puanı nasıl oluşturulur
Her Yanıt Kalitesi Testi aynı temel sırayı izler. Amaç tekrarlanabilirlik ve şeffaflıktır; tek bir manuel çalıştırmanın bilimsel bir kıyaslama (benchmark) olduğu iddiası değildir.
1–10 ölçeği
Zayıf: gereksinim büyük ölçüde karşılanmadı.
Kısmi: önemli eksikler devam ediyor.
İyi: gereksinim büyük ölçüde karşılandı, ancak sorun dikkate alınacak kadar önemli.
Çok iyi: neredeyse tamamen karşılandı; yalnızca küçük bir sorun var.
Bu testte tamamen karşılandı: o boyutta anlamlı bir sorun bulunmadı.
Bir boyut gerçekten uygulanabilir olmadığında kullanılır. “Uygulanamaz” durumunu yapay bir 10/10 puana çevirmeyiz.
Gerçek bir örnek: biçim kusursuz, anlam değişmiş
Örneğin Test 2 kapsamında dört asistandan bir yönetici için proje notunu özetlemeleri istendi. Kaynakta web sitesi yeniden tasarımının “12 Eylül’de yayına alınmasının planlandığı” yazıyordu. ChatGPT bunu şöyle özetledi: “Web sitesi yeniden tasarımı 12 Eylül’de yayına giriyor.”
Bu neden önemli: tarih korundu, ancak durum korunmadı. “Yayına alınması planlanıyor” koşullu bir proje bilgisidir; “yayına giriyor” ise olayı kesinmiş gibi sunar. Bir yönetim özetinde bu, proje durumuna dayalı kararları, son tarihleri ve beklentileri önemli ölçüde değiştirebilir.
Yanıt, görevin kısa bir yönetim özeti olduğunu anladı ve ilgili proje konularını korudu.
75 kelime sınırına uydu, tam üç madde işareti kullandı ve istendiği gibi Status:, Risk: ve Next action: etiketlerini kullandı.
Sonuç kısa ve doğru biçimlendirilmiş, ancak planlanan bir yayını kesin bir yayına dönüştürüyor. Yöneticiye yönelik bir özette bu, karar açısından önemli proje durumunu değiştirir ve planlamayı ciddi biçimde yanıltabilir.
CLEAR neyi gösterir — ve neyi iddia etmez
Bir yanıtın görevi anlayıp anlamadığını, istenen kısıtlara uyup uymadığını ve beklenen sonucu sunup sunmadığını — her puan için görünür bir gerekçeyle.
Her olgusal iddianın doğru olduğunu, bir asistanın genel olarak “en iyi” olduğunu veya tek bir manuel çalıştırmanın bir model için bilimsel kıyaslama olduğunu.
Olgusal doğrulama önemli olduğunda kaynaklar veya iddialar ayrıca kontrol edilip kanıt olarak belgelenebilir. CLEAR ise gerçekten test edilen prompta göre yanıt kalitesine odaklanır.