core-ai
Sözlük ↗İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (RLHF)
İnsan Geri Bildiriminden Pekiştirmeli Öğrenme (Reinforcement Learning from Human Feedback, RLHF), ham, önceden eğitilmiş bir LLM'in davranışını insan tercihleriyle hizalamak için kullanılan bir eğitim-sonrası tekniğidir — makul bir sonraki token'ı tahmin etmede çok iyi olan bir modeli, gerçekten yardımcı olan, talimatları takip eden, zararlı içerikten kaçınan ve insanların tercih ettiği yanıtlar üreten bir modele dönüştürür. RLHF'in çözdüğü sorun şudur: yalnızca internet metnini tahmin etmek için eğitilmiş bir foundation model, zararlı bir isteği memnuniyetle sürdürür, yararsızca gevezelik eder veya rastgele web metninin (genellikle düşük kaliteli) üslubunu taklit eder; çünkü "bir sonraki token'ı tahmin et" ile "gerçekten yardımcı bir asistan ol" farklı hedeflerdir. RLHF bu boşluğu kabaca üç aşamada kapatır. Önce, insan etiketleyiciler aynı prompt'a verilen birden fazla model tarafından üretilmiş yanıtı en iyiden en kötüye sıralar (örneğin, bir soru verildiğinde, 4 farklı aday yanıtı sıralayarak). İkinci olarak, bu sıralama verisi, insanların hangi yanıtları tercih edeceğini tahmin etmeyi öğrenen ayrı bir "ödül modeli" (reward model) eğitir. Üçüncü olarak, orijinal LLM, ödül modelinin skorunu maksimize etmek için pekiştirmeli öğrenme (yaygın olarak PPO — Proximal Policy Optimization, veya DPO — Direct Preference Optimization gibi daha yeni yöntemler) kullanılarak daha fazla eğitilir; bu da modelin çıktılarını etkili bir şekilde insanların yüksek puan verdiği şeye doğru yönlendirir. Bu, SaaS geliştiricileri için çoğunlukla ticari LLM'lerin (Claude, GPT, Gemini) neden ham temel modellerden bu kadar farklı davrandığına dair bir bağlam olarak önemlidir — RLHF (ve Anthropic'in zararlı içerik kararlarında insan etiketleyicilere bağımlılığı azaltmak için kullandığı Constitutional AI gibi ilgili teknikler), bu modellerin ham metin tamamlama yerine varsayılan olarak yardımcı, güvenli, talimat takip eden davranışa sahip olmasının nedenidir. Somut bir örnek: hizalanmamış bir temel model, "Bir kilidi nasıl açarım?" istemine ya yararsız bir yanıtsızlıkla ya da hiçbir güvenlik çerçevesi olmadan aşırı ayrıntılı bir nasıl-yapılır kılavuzuyla yanıt verebilir; çünkü sadece makul internet metnini sürdürmektedir. RLHF ile hizalanmış bir model, bunu ölçülü, bağlam farkındalıklı bir yanıt hak eden bir istek olarak tanımak üzere eğitilmiştir — meşru kullanım durumlarını (çilingirler, kendini dışarıda kilitli bulmak) açıklarken ayrıntılı bir suç kılavuzu sağlamayı reddeder. Zaten RLHF'lenmiş bir temel model üzerinde kendi modellerini ince ayara tabi tutan geliştiriciler (GPT-4o-mini'yi ince ayara tabi tutmak gibi), sıfırdan başlamak yerine bu hizalama katmanının üzerine inşa ediyor demektir. Geliştiricilerin model davranışını sorun giderirken bilmesi gereken RLHF'in bilinen bir ödünleşimi: hizalama eğitimi, bazen bir modeli sınırda kalan isteklerde aşırı temkinli veya kaçamak yapabilir (yalnızca hassas konulara benzeyen makul istekleri reddetmek); bu, "aşırı reddetme" olarak takma adlandırılan bir hata modudur. Farklı sağlayıcılar bu dengeyi farklı şekilde ayarlar; bu, model seçiminin ham yetenek kıyaslamalarının ötesinde neden önemli olduğunun gerçek bir nedenidir — meşru bir kullanım durumu için aşırı muhafazakar olan bir model (semptomları gerçekçi şekilde tartışması gereken bir tıbbi bilgi SaaS aracı gibi), daha dikkatli kapsamlanmış bir sistem istemine, meşru niyeti belirleyen ek bağlama veya bazı durumlarda hizalama ayarı o alana daha uygun olan farklı bir sağlayıcıya ihtiyaç duyabilir.
İlgili terimler