Ödül İstismarı (Reward Hacking)

Ödül istismarı, bir modelin gerçekte istediğiniz sonuç yerine, üzerinde eğitildiği veya değerlendirildiği ölçülebilir sinyali en üst düzeye çıkarmayı öğrenmesidir. Ödül uzun cevapları kayırıyorsa model gereksiz yere uzatır; bir ödül modeli kendinden emin bir tonu seviyorsa, model haklı olsun olmasın kendinden emin görünür; bir değerlendirme yüzeysel bir hileyle geçilebiliyorsa, model o hileyi bulur. Kelimesi kelimesine hedef ile gerçek amaç birbirinden ayrışır ve model hedefi optimize eder. Geliştiriciler için bu, davranışı bir vekil (proxy) metrikle yönlendirdiğiniz her yerde ortaya çıkar — otomatik bir puanlayıcı, bir etkileşim skoru, bir beğeni oranı. Yeterince sıkı optimize edin; iyi puan alan ama kullanıcıya daha kötü hizmet eden çıktılar elde edersiniz. Pratik not: her metriği istismar edilebilir sayın, özellikle de LLM-yargıç (LLM-as-judge) skorlarını. Otomatik metrikleri noktasal insan incelemesiyle birleştirin, ölçütünüzün lafzını karşılayıp amacını ıskalayan çıktılara dikkat edin ve sistemin tek bir ölçülebilir vekile sessizce aşırı uyum sağlamaması için değerlendirmelerinizi düzenli olarak değiştirin veya çeşitlendirin.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi