Yapay Zekâ Yanıtlarını Nasıl Test Ediyoruz — CLEAR

Bağlam. Kısıtlar. Beklenen Yanıt ve Sonuç.

CLEAR, Yanıt Kalitesi Testlerimizin arkasındaki kompakt çerçevedir. Aynı üç öğe önce bir promptu tanımlamaya, ardından ilk yanıtın onu ne kadar iyi yerine getirdiğini değerlendirmeye yardımcı olur.

Tek çerçeve, iki görev

CLEAR bilinçli olarak küçük tutulmuştur. Prompt yazarken de yanıtı değerlendirirken de aynı üç soruyu kullanır. Böylece model yanıt vermeden önce test ölçütleri görünür olur; sonradan bir puanlama sistemi uydurulmaz.

C — Bağlam (Context)

Prompt yazarken: Yapay zekâ neyi bilmeli? Değerlendirirken: Yanıt, ilgili bağlamı doğru anlayıp kullandı mı?

L — Kısıtlar (Limits)

Prompt yazarken: Hangi kurallar geçerli? Değerlendirirken: Yanıt, istenen kurallara, kısıtlara ve sınırlara uydu mu?

EAR — Beklenen Yanıt ve Sonuç (Expected Answer & Result)

Prompt yazarken: Yapay zekâ tam olarak ne döndürmeli? Değerlendirirken: Yanıt gerçekten beklenen yanıtı ve sonucu sundu mu?

Neden kompakt tutuluyor? Bir değerlendirme ancak okuyucular neden verildiğini görebiliyorsa yararlıdır. CLEAR boyutları hatırlanacak kadar genel tutar; ancak her puan yine de somut ve görünür bir açıklama gerektirir.

C — Bağlam

Bağlam, yanıtın kendisine verilen durumu anlayıp anlamadığını sorgular. Buna kullanıcının amacı, hedef kitlesi, kaynak materyali, bilgi düzeyi, değişmeden kalması gereken gerçekler veya görevi doğru yanıtlamak için gereken diğer bilgiler dahil olabilir.

Örnek: Bir prompt, daha önce istatistik öğrenmemiş 15 yaşındaki biri için açıklama istiyorsa güçlü bir yanıt, kavramı yanlış bir şeyle değiştirmeden o kitle için sadeleştirmelidir.

Yüksek bir Bağlam puanı, yanıttaki her olgusal iddianın bağımsız olarak doğrulandığı anlamına gelmez. Yanıtın o görev için sağlanan bağlamı doğru kullandığı anlamına gelir.

L — Kısıtlar

Kısıtlar, yanıtın biçimini belirleyen açık kurallardır. Mümkün olduğunda bunları nesnel olarak kontrol edilebilir hale getiririz: kelime sayısı, madde işareti sayısı, paragraf sayısı, gerekli etiketler, zorunlu kapanış cümlesi veya yalnızca ücretsiz kaynakların kullanılması gibi bir kısıt.

Önce ölç

Kelime sayısı ve gerekli öğe sayısı gibi mekanik kontroller, görünüşe bakılarak tahmin edilmez; olgu olarak kaydedilir.

Sonra değerlendir

Anlamı korumak veya istenen tonu sürdürmek gibi yorum gerektiren kısıtlar, görünür değerlendirmede açıklanır.

Önemli: Biçim kurallarına kusursuz uymak otomatik olarak yüksek kaliteli bir sonuç anlamına gelmez. Bir yanıt Kısıtlar için 10/10 alabilir; ancak anlamı değiştirirse veya asıl görevi kaçırırsa Beklenen Yanıt ve Sonuç boyutunda puan kaybedebilir.

EAR — Beklenen Yanıt ve Sonuç

EAR en pratik soruyu sorar: Yanıt, kullanıcıya gerçekten ihtiyaç duyduğu şeyi verdi mi? Burada eksiksizliği, yararlılığı, anlamın korunmasını ve sonucun istenen amaca uygun olup olmadığını değerlendiririz.

İyi biçim, zayıf sonuç

Bir yanıt kelime sınırının altında kalıp doğru etiketleri kullanabilir; yine de önemli bir bağımlılığı atlayabilir, kesinlik düzeyini değiştirebilir veya amaçlanan kullanım için hazır olmayan bir şey üretebilir.

Güçlü sonuç

Yanıt görevi bir bütün olarak yerine getirir: ilgili bağlamı kullanır, kurallara uyar ve kullanıcının istediği anlamı ve pratik sonucu korur.

E-posta örneği: Bizim e-posta yeniden yazma testimizde, profesyonel bir e-posta gerekli tüm bilgileri korusa bile normal bir kapanışı atladığında eksik hissedilebilir. Prompt bunu açıkça istemediyse bu mutlaka bir Kısıtlar hatası değildir, ancak EAR’ı etkileyebilir.

CLEAR puanı nasıl oluşturulur

Her Yanıt Kalitesi Testi aynı temel sırayı izler. Amaç tekrarlanabilirlik ve şeffaflıktır; tek bir manuel çalıştırmanın bilimsel bir kıyaslama (benchmark) olduğu iddiası değildir.

1
Tam promptu sabitle
O testte her asistan için aynı prompt metni kullanılır.
2
İlk tam yanıtı kaydet
Yeni sohbet, yeniden oluşturma yok, takip mesajı yok. Orijinal ekran görüntüsü kanıt olarak saklanır.
3
Görünür koşulları kaydet
Tarih, gösterilen model, hesap, web/arama durumu ve diğer ilgili ayarlar belgelenir.
4
Ölçülebilir kısıtları kontrol et
Kelime sayıları, madde sayıları, etiketler ve diğer nesnel kısıtlar doğrudan kontrol edilir. Tutarlılık için kelime sayımında görünür yanıttaki boşlukla ayrılmış tokenlar kullanılır. Başlıklar, etiketler, selamlamalar, kapanışlar ve modelin eklediği notlar dahil edilir; Markdown biçimlendirmesinin kendisi dahil edilmez.
5
C, L ve EAR’ı ayrı ayrı puanla
Her puanın görünür bir gerekçesi vardır. 10/10 vermeden önce, “bariz bir sorun yok” yaklaşımını kusursuz sonucun kanıtı saymak yerine ilgili tarihleri, sayıları, bağımlılıkları, kesinliği ve anlamı aktif olarak yeniden kontrol ederiz.

1–10 ölçeği

1–3

Zayıf: gereksinim büyük ölçüde karşılanmadı.

4–6

Kısmi: önemli eksikler devam ediyor.

7–8

İyi: gereksinim büyük ölçüde karşılandı, ancak sorun dikkate alınacak kadar önemli.

9

Çok iyi: neredeyse tamamen karşılandı; yalnızca küçük bir sorun var.

10

Bu testte tamamen karşılandı: o boyutta anlamlı bir sorun bulunmadı.

N/A

Bir boyut gerçekten uygulanabilir olmadığında kullanılır. “Uygulanamaz” durumunu yapay bir 10/10 puana çevirmeyiz.

Neden genel bir kazanan puanı yok? C, L ve EAR’ı ayrı tutmak sorunları görmeyi kolaylaştırır. Kusursuz bir biçim puanı, anlamdaki önemli bir değişikliği ortalamada görünmez hale getirmemelidir.

Gerçek bir örnek: biçim kusursuz, anlam değişmiş

Örneğin Test 2 kapsamında dört asistandan bir yönetici için proje notunu özetlemeleri istendi. Kaynakta web sitesi yeniden tasarımının “12 Eylül’de yayına alınmasının planlandığı” yazıyordu. ChatGPT bunu şöyle özetledi: “Web sitesi yeniden tasarımı 12 Eylül’de yayına giriyor.”

Bu neden önemli: tarih korundu, ancak durum korunmadı. “Yayına alınması planlanıyor” koşullu bir proje bilgisidir; “yayına giriyor” ise olayı kesinmiş gibi sunar. Bir yönetim özetinde bu, proje durumuna dayalı kararları, son tarihleri ve beklentileri önemli ölçüde değiştirebilir.

Bağlam 10/10

Yanıt, görevin kısa bir yönetim özeti olduğunu anladı ve ilgili proje konularını korudu.

Kısıtlar 10/10

75 kelime sınırına uydu, tam üç madde işareti kullandı ve istendiği gibi Status:, Risk: ve Next action: etiketlerini kullandı.

EAR 5/10

Sonuç kısa ve doğru biçimlendirilmiş, ancak planlanan bir yayını kesin bir yayına dönüştürüyor. Yöneticiye yönelik bir özette bu, karar açısından önemli proje durumunu değiştirir ve planlamayı ciddi biçimde yanıltabilir.

CLEAR’ın Kısıtlar ile EAR’ı ayırmasının nedeni budur: yanıt görünür tüm biçim kurallarına uyabilir ve yine de önemli bir kalite sorunu taşıyabilir.

CLEAR neyi gösterir — ve neyi iddia etmez

CLEAR şunu göstermek için tasarlanmıştır

Bir yanıtın görevi anlayıp anlamadığını, istenen kısıtlara uyup uymadığını ve beklenen sonucu sunup sunmadığını — her puan için görünür bir gerekçeyle.

CLEAR şunu kanıtlamak için tasarlanmamıştır

Her olgusal iddianın doğru olduğunu, bir asistanın genel olarak “en iyi” olduğunu veya tek bir manuel çalıştırmanın bir model için bilimsel kıyaslama olduğunu.

Olgusal doğrulama önemli olduğunda kaynaklar veya iddialar ayrıca kontrol edilip kanıt olarak belgelenebilir. CLEAR ise gerçekten test edilen prompta göre yanıt kalitesine odaklanır.

CLEAR’ın gerçek yanıtlara uygulanışını gör

Beş pratik prompt ve iki bonus testte manuel olarak CLEAR ile değerlendirilen 28 yanıtı, ayrıca ayrı bir Eğlenceli Promptta topluluk tarafından puanlanan 4 yanıtı karşılaştırmak için Yanıt Kalitesi Testlerini aç.

Bu CLEAR rehberini paylaş

PromptingEasy uygulamasını ekranına ekle

Tarayıcı menünü kullan ve bu siteyi yükleme veya ana ekranına ekleme seçeneğini seç.