Pekiştirmeli Öğrenme (RL)

Pekiştirmeli öğrenme, bir modelin doğru cevaplar gösterilerek değil eyleyip puanlanarak öğrendiği kurulumdur. Bir ajan bir durumu gözler, bir eylem yapar, bir ödül alır ve yeni bir duruma iner; çok sayıda bölüm boyunca en fazla ödülü biriktiren bir politika — durumlardan eylemlere bir eşleme — öğrenir. Doğru hamleyi kimse etiketlemez. Sinyal yalnızca işlerin iyi gidip gitmediğidir ve genelde önemli olan karardan çok sonra gelir; RL'i hem güçlü hem de zahmetli kılan budur. Bu zahmetin bir adı var: kredi atama. Bir oyun altmışıncı hamlede kaybedildiyse, önceki elli dokuz hamleden hangisi hataydı? RL makinesini bunu yanıtlamaya harcar ve yanıt istatistikseldir; RL'in gözetimli öğrenmenin olmadığı biçimde örnek açlığı çekmesinin nedeni budur. Ünlü başarılarının benzetimde olmasının nedeni de bu: oyunlar, robotik düzenekler, trafik yönlendirme — bir ajanın bedavaya milyonlarca kez başarısız olabildiği yerler. Canlı bir iş sisteminde keşif, öğrenmek için daha kötü olmasını beklediğiniz seçimleri bilerek yapmak demektir ve bunun gerçek parayla gerçek bir maliyeti vardır. Çoğu SaaS ekibi için RL'in ilgisi dolaylı ama önemlidir: modern dil modellerinin hizalanma biçimi budur. İnsan geri bildiriminden pekiştirmeli öğrenme, aday yanıtlar arasındaki insan tercihleri üzerinde bir ödül modeli eğitir, sonra RL kullanarak dil modelini o ödül modelinin beğendiğine doğru iter. Doğrudan tercih optimizasyonu benzer sonucu ayrı bir RL döngüsü olmadan elde eder. Yalnızca metni sürdüren ham bir önceden eğitilmiş modelin soruları yanıtlayan ve zararlı istekleri reddeden bir asistana dönüşmesinin nedeni ikisidir. Terminoloji, adlandırdığı hata biçimleri için taşımaya değer. Ödül istismarı, bir politikanın amaçlanan sonuç yerine ölçülen sinyali en üst düzeye çıkarmasıdır; hizalanmış modellerde uzun sözlülük, çekingenlik ve kendinden emin ton olarak görünür — bir ödül modelinin yüksek puanladığı davranışlar. Keşif ile sömürü arasındaki gerilim, A/B testinin ve haydut algoritmalarının arkasındaki aynı gerilimdir; çoğu ürün ekibinin gerçekten uzanacağı RL komşusu araçlar bunlardır.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi