Foundation Model (Temel Model)

Foundation model (temel model), tipik olarak bir LLM olan ama aynı zamanda çok modlu (multimodal) veya görü modelleri de olabilen, genel yetenekler geliştirmek için geniş, çeşitli bir veri kümesi (internetin, kitapların, kod depolarının büyük bir kısmı) üzerinde önceden eğitilmiş büyük ölçekli bir modeldir; açık niyet, yalnızca tek bir dar amaç için değil, daha sonra belirli alt görevlere uyarlanmasıdır. Terim (2021'de Stanford'un Foundation Models Araştırma Merkezi tarafından ortaya atılmıştır), yapay zekanın nasıl inşa edildiğindeki bir değişimi yakalar: her görev için (duygu analizi, çeviri, özetleme, her biri kendi modeline sahip olacak şekilde) sıfırdan ayrı bir model eğitmek yerine, büyük bir maliyetle bir kez devasa genel bir model eğitir ve ardından bunu — prompt yazma, RAG veya ince ayar aracılığıyla — yüzlerce farklı uygulamaya ucuza ve tekrar tekrar "uyarlarsınız". Claude, GPT-4/5, Gemini ve Llama'nın hepsi birer foundation model'dir; bir SaaS şirketinin müşteri destek chatbot'u, kod inceleme asistanı ve pazarlama metni üreteci, yalnızca prompt'lar, geri getirilen bağlam ve (bazen) ince ayarla ayrılan tam olarak aynı temel foundation model üzerine inşa edilmiş olabilir. Bu, geliştiriciler için yap-ya-da-satın-al kararları için bir zihinsel model olarak önemlidir: bugün neredeyse hiçbir SaaS şirketi sıfırdan bir foundation model eğitmiyor (hesaplama maliyeti, iyi fonlanmış birkaç yapay zeka laboratuvarı dışında herkes için yasaklayıcıdır) — bunun yerine, tüm yapay zeka ürün katmanı, API aracılığıyla erişilen veya kendi kendine barındırılan açık ağırlıklar aracılığıyla erişilen foundation model'ler üzerine inşa edilir. Somut bir örnek: bir hukuk teknolojisi (legal-tech) girişimi, sözleşmeleri anlamak için kendi dil modelini eğitmez; Claude gibi bir foundation model alır, sözleşme şablonları ve içtihat hukuku derlemi üzerine bir RAG hattı ekler, hukuki inceleme davranışı oluşturan ayrıntılı bir sistem istemi yazar ve bir "sözleşme inceleme asistanı" sunar — gerçek dil anlama yeteneği tamamen foundation model'den miras alınmıştır, ürünün farklılaşması ise veri, prompt'lar ve etrafına inşa edilen iş akışından gelir. Foundation model'ler genellikle kapalı (yalnızca API erişimi, Claude ve GPT gibi) veya açık ağırlıklı (indirilebilir model dosyaları; kendi kendine barındırabilir ve değiştirebilirsiniz, Llama ve Mistral gibi) olarak sınıflandırılır — bu ayrım, veri gizliliği, özelleştirme derinliği ve ölçekte maliyet açısından önemlidir. Foundation model paradigması ayrıca SaaS şirketlerinin teknik hendekleri hakkında nasıl düşündüğünü de yeniden şekillendirir: temel dil yeteneği büyük ölçüde metalaştığı ve herhangi bir rakip tarafından aynı API'ler aracılığıyla erişilebilir olduğu için, kalıcı farklılaşma giderek daha fazla tescilli veriden (rakiplerin erişemediği, yanıtları dayandırabileceğiniz ve zemine oturtabileceğiniz veri), iş akışı entegrasyonundan (yapay zeka özelliğinin mevcut bir ürün yüzeyine ne kadar derinlemesine dokunduğu) ve değerlendirme/kalite kontrol altyapısından (yapay zeka özelliğini ölçekte ne kadar güvenilir şekilde doğru tutabildiğiniz) gelir — modelin kendisinden değil; iyi fonlanmış herhangi bir rakip, karşılaştırılabilir koşullarda ona erişebilir.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi