Transformer nedir?
Transformer, birçok modern LLM'nin arkasındaki mimaridir. Temel fikri, modelin bağlam içindeki ilişkileri ağırlıklandırabilmesi için tokenları dikkat (attention) katmanlarıyla işlemektir. Bu, eğitimi eski recurrent yaklaşımlara göre daha fazla paralelleştirilebilir hâle getirdi ve modern dil modellerinin temelini oluşturdu.

Teknik istek yaşam döngüsü
Üretimdeki bir LLM isteği genellikle tek bir model çağrısı değil, bir işlem hattıdır. Uygulama girdiyi doğrular, promptu oluşturur, gerekirse bağlam getirir, tokenları modele gönderir, isteğe bağlı olarak araç çağırır, çıktıyı kontrol eder ve daha sonra değerlendirme için iz kayıtlarını saklar.
Sistem talimatlarını, kullanıcı girdisini, belleği, örnekleri ve politikaları tek bir sıralı bağlamda birleştirir.
İlgili parçaları bulmak için bir vektör veritabanında veya anahtar kelime indeksinde arama yapan isteğe bağlı adım. Geri getirmeyle zenginleştirilmiş üretimin (Retrieval-Augmented Generation, RAG) temelidir.
Model sonraki token olasılıklarını hesaplar. Sıcaklık (temperature) gibi kod çözme (decoding) ayarları yanıtın ne kadar deterministik veya çeşitli olacağını etkiler.
Uygulama, yanıtı kullanıcıya göstermeden önce atıfları, şemayı, politika uyumunu veya araç çıktılarını doğrulayabilir.
Embedding nedir?
Embedding'ler; metni, görselleri veya başka verileri, benzer anlamların birbirine daha yakın olma eğiliminde olduğu bir uzayda temsil eden sayısal vektörlerdir. Semantik arama, kümeleme, öneriler ve bilgi getirme (retrieval) için faydalıdır. Önemli ayrıntı: embedding'ler gerçek değildir; benzerlik sinyalleridir.

Öz-dikkat (self-attention) nedir?
Öz-dikkat (self-attention), her tokenın aynı bağlamdaki diğer tokenları ağırlıklandırmasını sağlar. Model katmanlar boyunca ilişkileri tekrar tekrar hesaplayarak kelimelerin, ifadelerin ve bağımlılıkların daha zengin temsillerini oluşturur. LLM'lerin uzun talimatları ve örnekleri kullanabilmesinin nedenlerinden biridir.

Tokenizasyonun ayrıntıları
Tokenizasyon, metni modelin okuyabileceği birimlere dönüştürür. Farklı diller ve yazı sistemleri tokenları farklı kullanabilir; bu da maliyeti ve bağlam uzunluğunu etkiler. Tokenizasyon ayrıca tam karakter sınırlarının, kod parçalarının ve nadir kelimelerin neden zor olabildiğini açıklar.

Geri Getirmeyle Zenginleştirilmiş Üretim (RAG) Mimarisi
Üretimdeki bir RAG sistemi veri alma (ingestion), parçalama (chunking), embedding'ler, indeks, bilgi getirme (retrieval), yeniden sıralama (reranking), prompt birleştirme, yanıt üretimi, atıflar ve değerlendirmeyi içerebilir. Birçok hata üretimden önce başlar — örneğin kötü parçalar (chunk'lar), eski belgeler, zayıf sıralama veya eksik erişim filtreleri — başka hatalar ise sentez, atıf, reddetme veya yanıt üretimi sırasında ortaya çıkar.

Güvenlik, değerlendirme, araçlar, ajanlar ve gerçek uygulamaların çevresinde gereken kontrollerle devam et.
Prompt Injection
Prompt injection, güvenilmeyen metnin sistem veya geliştirici talimatlarını geçersiz kılmaya çalışmasıdır. RAG ve ajan iş akışlarında yaygındır çünkü getirilen sayfalar gizli talimatlar içerebilir. Harici içeriği otorite değil, veri olarak ele al.
Büyük Dil Modeli (LLM) Değerlendirmesi
LLM değerlendirmesi, çıktıların doğru, faydalı, güvenli ve tutarlı olup olmadığını ölçer. Otomatik kontroller, model tarafından puanlanan rubrikler, insan incelemesi ve göreve özel testlerin bir karışımını kullan. Özellikle prompt, model veya bilgi getirme değişikliklerinden sonra regresyonları zaman içinde izle.
İşlev Çağırma (Function Calling)
İşlev çağırma (function calling), bir modelin serbest metin yerine bir araç için yapılandırılmış argümanlar döndürmesini sağlar. Uygulama daha sonra aracı çağırıp çağırmayacağına, argümanları doğrulamaya ve hataları yönetmeye karar verir. Model güvenlik sınırı olmamalıdır.
Ajan nedir?
Ajan, adımları planlayabilen, araçları çağırabilen, sonuçları gözlemleyebilen ve sırada ne yapacağına karar verebilen LLM odaklı bir sistemdir — bir hedefe ulaşılana veya durdurma koşulu tetiklenene kadar döngüyü sürdürür. Tek yanıt döndüren tek bir promptun aksine ajan şu döngüyü çalıştırır: akıl yürüt, hareket et, gözlemle, tekrarla. Bu, ajanları çok adımlı işler için güçlü yapar; ancak tek bir isteğe göre değerlendirmeyi, güvenli hâle getirmeyi ve öngörülebilir tutmayı da zorlaştırır.
Pratik bir ajan genellikle dört parçayı birleştirir: plan yapan bir model, çağırabileceği bir araç seti (arama, kod çalıştırma, API), ilerlemeyi takip eden bir bellek veya çalışma notları (scratchpad) ve hangi eylemlerin insan onayı gerektirdiğine karar veren koruma mekanizmaları. Model hiçbir zaman güvenlik sınırı değildir — çevredeki uygulama her eylemi çalışmadan önce doğrular.
Large Action Model'ler (LAM'ler)
“Large Action Model” (LAM) gayriresmî bir sektör etiketidir; tek bir standart mimari veya evrensel olarak ayrı bir model sınıfı değildir. Genellikle yalnızca açıklayıcı metin üretmek yerine araç çağırma, arayüzleri kullanma veya yazılım adımları dizisi üretme gibi eylemleri seçip yürütmek için optimize edilmiş bir model veya ajan bileşenini tanımlar.
Pratikte “LAM” ve “LLM ajanı” tutarsız biçimde kullanılır. Faydalı bir kavramsal ayrım şudur: ajan tüm sistemdir — model, araçlar, bellek veya durum, politikalar, yürütme ortamı ve onay adımları — “LAM” ise eylem seçme bileşenini ifade edebilir. Birçok üretim sistemi, ayrı tanımlanmış bir LAM mimarisi yerine LLM + araç çağırma + durum yönetimi + koruma mekanizmalarıle eylemler uygular.
Çok ajanlı sistemler ve araç protokolleri
Görevler büyüdükçe tek bir ajan çoğu zaman iş birliği yapan birkaç uzman ajana bölünür: biri planlar, biri bağlam getirir, biri yürütür ve biri herhangi bir şey onaylanmadan önce sonucu kontrol eder. Bu, küçük bir ekibin işi bölüşmesine benzer ve her parçayı her şeyi yapmaya çalışan tek bir ajana göre test etmeyi ve yönetmeyi kolaylaştırır.
Farklı entegrasyon katmanları için açık protokoller ortaya çıkıyor. Model Context Protocol (MCP), araçları, kaynakları ve promptları yapay zekâ uygulamalarına sunmak için bir istemci-sunucu protokolü tanımlar. Agent2Agent (A2A) protokolü ise ajanlar arasında keşif, iletişim ve görev devrine odaklanır. Birbirlerini tamamlayabilirler; ancak destek, güvenlik profilleri ve benimsenme düzeyi değişir. İkisini birden kullanmak mimari bir seçenektir, evrensel bir 2026 standardı değildir.
Halüsinasyon teknik olarak nedir?
Halüsinasyonlar, akıcı üretim ile dayanaklı doğrulama arasındaki boşluktan doğar. Model kanıtı olmadığında, getirilen bağlamı yanlış okuduğunda veya eğitim örüntülerinden aşırı genelleme yaptığında bile olası metin üretebilir. Azaltma; bilgi getirme kalitesi, belirsizlik yönetimi, doğrulama ve değerlendirme gerektirir — yalnızca promptu daha iyi ifade etmeyi değil.
