Anahtar-Değer (KV) Önbelleği
KV önbellekleme, otoregresif üretim sırasında önceki tokenlardan gelen anahtar-değer tensörlerini saklar. Model her yeni token için tüm ön eki yeniden hesaplamak yerine önbelleğe alınmış temsilleri yeniden kullanır. Bu, uzun çıktılarda gecikmeyi azaltır ancak aktif istek başına bellek baskısını artırır.

LLM uygulamaları için üretim kontrol katmanı
Uzman düzeyindeki LLM sistemleri tek bir kusursuz modelden çok yönlendirme, önbellekleme, değerlendirme, güvenlik kontrolleri ve geri bildirim döngüleriyle ilgilidir. Güvenilir bir platform hangi modelin çağrılacağına, hangi bağlamın getirileceğine, daha ucuz bir modelin ne zaman kullanılacağına, ne zaman daha güçlü bir modele veya insan incelemesine aktarılacağına ve regresyonların nasıl tespit edileceğine karar verir.
İstekleri standartlaştırır, hız sınırı uygular, kiracı meta verisi ekler ve aday modelleri seçer.
Görev zorluğuna, gecikme bütçesine ve riske göre küçük, büyük veya uzmanlaşmış bir model seçer.
Bilgi getirme (retrieval) kalitesini, yanıt kalitesini, atıf bağlılığını, güvenliği ve şema geçerliliğini puanlar.
Promptları, getirilen parçaları, model sürümlerini, token sayılarını, gecikme yüzdeliklerini ve hata türlerini izler.
Uzman Karışımı (Mixture of Experts)
Uzman Karışımı (MoE), tokenları veya örnekleri uzmanlaşmış ağların bir alt kümesine yönlendirir. Bu, her token için her parametreyi kullanmadan toplam parametre sayısını artırabilir. Karşılığında yönlendirme karmaşıklığı, yük dengeleme, iletişim yükü ve daha zor hata ayıklama gelir.
Spekülatif Kod Çözme (Speculative Decoding)
Spekülatif kod çözme, token önermek için bir taslak model veya taslak prosedürü ve bunları doğrulamak için hedef model kullanır. Kesin spekülatif örnekleme algoritmaları hedef modelin çıktı dağılımını koruyabilir; sezgisel varyantlar hız uğruna kesinlikten ödün verebilir. Hızlanma; kabul oranına, taslak maliyetine, dizi ve toplu iş (batch) yapısına, çalışma ortamına ve donanıma bağlıdır.

Kuantizasyon (Quantization)
Kuantizasyon; model ağırlıklarının, aktivasyonların veya önbelleklerin hassasiyetini, örneğin 16-bit'ten 8-bit veya 4-bit'e düşürür. Bellek kullanımını azaltabilir ve donanım, kernel'ler, çalışma zamanı ve iş yükü seçilen formatı desteklediğinde iş hacmini artırabilir; ayrıca kaliteyi, kalibrasyonu veya araç çağrısı güvenilirliğini düşürebilir.

LoRA ve İnce Ayar (Fine-Tuning)
LoRA genellikle temel modeli dondurur ve düşük dereceli adaptör parametrelerini eğitir; böylece tam ince ayara göre eğitilebilir parametre sayısını ve çoğu zaman bellek ihtiyacını azaltır. Davranış, tarz, format veya görev/alan uyarlaması için faydalıdır; ancak gerçekler sık değişiyorsa bilgi getirmenin güvenilir bir alternatifi değildir. Her türlü bilgi uyarlaması yine veriye, eğitim kurulumuna ve değerlendirmeye bağlıdır.
Model optimizasyonundan tercih ayarlama, gözlemlenebilirlik, değerlendirme, güvenlik, yönlendirme ve maliyet kontrolüne geç.
Direct Preference Optimization (DPO) ve İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF)
RLHF ve DPO, insan veya tercih verilerini kullanarak model davranışını optimize eder. RLHF genellikle ödül modelleme ve politika optimizasyonu içerir. DPO ise tercihleri daha basit bir amaç fonksiyonuyla doğrudan optimize eder. Her ikisi de tercih kalitesine bağlıdır ve değerlendiricilerin ödüllendirdiği özelliklere aşırı uyum sağlayabilir.
LLM Gözlemlenebilirliği (Observability)
LLM gözlemlenebilirliği; promptları, bilgi getirme sonuçlarını, araç çağrılarını, gecikmeyi, maliyeti, kullanıcı geri bildirimini, güvenlik olaylarını ve değerlendirme puanlarını izler. Günlükler gizlilik açısından dikkatli olmalıdır: hata ayıklamaya yetecek kadar veri topla, gereksiz hassas verileri saklama.

Retrieval-Augmented Generation (RAG) Değerlendirmesi
RAG değerlendirmesi bilgi getirme kalitesini yanıt kalitesinden ayırır. Doğru belgelerin bulunup bulunmadığını, yanıtın bunları kullanıp kullanmadığını, atıfların iddiaları destekleyip desteklemediğini ve nihai çıktının görevi karşılayıp karşılamadığını ölç.
Üretim yığını dışındaki somut bir yanıt değerlendirmesi örneği için Yanıt Kalitesi Testlerine bak; burada aynı promptlar dört asistan arasında karşılaştırılır.
Model Yönlendirme (Model Routing)
Model yönlendirme her görevi yeterli olan en ucuz modele veya iş akışına gönderir. Basit sınıflandırma küçük bir model kullanabilir; karmaşık akıl yürütme daha güçlü bir model kullanabilir; riskli yanıtlar bilgi getirme ve inceleme gerektirebilir. Yönlendirme yalnızca kalite kontrolleri yanlış yönlendirmeleri yakalarsa maliyet tasarrufu sağlar.
Yapay Zekâ Güvenliğinde Kırmızı Takım Testi (Red Teaming)
Red teaming, sistemlerin kasıtlı olarak zorlayıcı veya sıra dışı girdiler altında nasıl başarısız olduğunu test eder. LLM uygulamalarında prompt injection, veri sızıntısı, güvensiz araç kullanımı, politika aşma, gizli talimatlar ve sosyal mühendislik promptlarını test et. Amaç kusursuzluğu kanıtlamak değil, kontrolleri geliştirmektir.
Büyük Dil Modeli (LLM) Uygulamaları için Maliyet Optimizasyonu
Maliyet optimizasyonu; prompt sıkıştırma, önbellekleme, yönlendirme, toplu işleme, bağlam budama, bilgi getirme kalitesi, kuantizasyon ve değerlendirmeyi birleştirir. Yalnızca token başına maliyeti değil, başarılı görev başına maliyeti optimize et. Üç yeniden deneme gerektiren ucuz bir model, bir kez çalışan güçlü bir modelden daha pahalı olabilir.