Büyük Dil Modeli (LLM)

Büyük dil modeli (LLM), devasa miktarda metin (ve giderek artan biçimde kod, görsel ve ses) üzerinde eğitilerek bir dizideki bir sonraki token'ı tahmin etmeyi öğrenen bir sinir ağıdır — neredeyse her zaman bir transformer mimarisine dayanır. Yüzlerce milyar hatta trilyonlarca parametre ve trilyonlarca eğitim token'ı ölçeğinde uygulanan bu basit eğitim hedefi, yazabilen, özetleyebilen, çevirebilen, adım adım akıl yürütebilen ve sohbet edebilen modeller ortaya çıkarır. Claude, GPT-4/GPT-5, Gemini ve Llama'nın hepsi birer LLM'dir; ancak mimari detaylar, eğitim verisi ve yardımcı/güvenli olacak şekilde nasıl hizalandıkları bakımından farklılık gösterirler. SaaS geliştiricileri için LLM, bugün sunulan hemen her "yapay zeka özelliğinin" arkasındaki akıl yürütme motorudur — destek chatbot'ları, mevcut araçlara gömülü kopilotlar, içerik üreticiler ve otonom ajanlar. Pratikte önemli olan şu: bir LLM, bir veritabanı değil, olasılıksal bir sonraki-token tahmincisidir; gerçekleri "aramaz", eğitim sırasında öğrendiği her şeye dayanarak isteminizin istatistiksel olarak en olası devamını üretir. LLM'lerin halüsinasyon görmesinin, onları retrieval (RAG) ile gerçek verilere dayandırmanın önemli olmasının ve prompt (istem) tasarımının çıktı kalitesi üzerinde orantısız bir etkiye sahip olmasının nedeni budur. Kaputun altında, bir LLM API'sine gönderilen istek bir mesaj listesidir (sistem istemi, kullanıcı turları, asistan turları) ve buna sıcaklık (temperature) ile maksimum token gibi parametreler eklenir; model, token token akışla (streaming) bir tamamlama (completion) döndürür. Somut bir örnek: bir destek talebi (ticket) sınıflandırma özelliği şunu gönderebilir: `{"model": "claude-sonnet-4.5", "system": "Talepleri fatura, hata, özellik talebi veya diğer olarak sınıflandır. Sadece kategoriyi yanıtla.", "messages": [{"role": "user", "content": "Aynı fatura için kartımdan iki kez para çekildi."}]}` ve bir saniyeden kısa sürede `"fatura"` yanıtını alır. Geliştiriciler bir LLM seçerken token başına maliyeti, gecikmeyi (latency), bağlam penceresi (context window) boyutunu ve sağlayıcının ince ayara (fine-tuning) izin verip vermediğini ya da yalnızca prompt tabanlı özelleştirme gerektirip gerektirmediğini tartar. Açık ağırlıklı modeller (Llama, Mistral) veri kontrolü için kendi sunucularınızda barındırılabilir; kapalı modeller (Claude, GPT) ise API üzerinden erişilir ve sağlayıcı tarafından güncellenir. Bir SaaS özelliği için LLM seçmek nadiren tek seferlik bir karardır — çoğu üretim ekibi, aynı model ailesi içinde farklı görevleri farklı model katmanlarına yönlendirir (basit sınıflandırma için hızlı, ucuz bir model; karmaşık akıl yürütme için uç (frontier) bir model) ve yeni sürümler çıktıkça yeniden değerlendirme yapar, çünkü altı ay önce son teknoloji olan bir model bugün hem maliyet hem de kalite açısından daha yeni bir sürüm tarafından geride bırakılmış olabilir. Geliştiriciler ayrıca LLM çıktısının varsayılan olarak deterministik olmadığını (düşük sıcaklıkta bile, çağrılar arasında bayt bayt aynı tekrarlanabilirlik garanti edilmez) ve sürümlendiğini (bir sağlayıcının eski bir model sürümünü kullanımdan kaldırması, ürününüzün davranışını sessizce değiştirebilir) bütçelemelidir; bu yüzden model sürümlerini sabitlemek ve çıktı kalitesini zaman içinde izlemek paranoya değil, standart bir üretim pratiğidir.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi