Perplexity (Şaşkınlık Metriği)

Perplexity, bir dil modelinin bir metin örneğini ne kadar iyi tahmin ettiğini ölçer: token başına ortalama negatif log-olabilirliğin üstelidir; sezgisel olarak modelin her adımda "arasında kararsız kaldığı" seçenek sayısıdır. Perplexity 1, kusursuz tahmin demektir; 20 ise modelin ortalamada 20 token arasından rastgele seçim kadar kararsız olduğu anlamına gelir. Düşük olan iyidir. N-gram çağından beri dil modellemenin temel metriği olmuştur ve ön eğitim ilerlemesini ve niceleme (quantization) hasarını hâlâ iyi izler — perplexity'si neredeyse hiç kımıldamayan sıkıştırılmış bir model büyük olasılıkla sağlam kalmıştır. Ama sınırları önemlidir: perplexity puanları yalnızca aynı tokenizer'ı paylaşan modeller arasında karşılaştırılabilir ve düşük perplexity talimat izleme, olgusallık ya da kullanışlılık garantisi vermez; sohbet çağında değerlendirmenin benchmark'lara ve insan ya da LLM yargılı karşılaştırmalara yaslanmasının nedeni budur. Yanıt motoru ürünü Perplexity AI ile karıştırılmamalıdır. Perplexity'nin yerini gerçekten hak ettiği alan ürün panosu değil, eğitim ve araştırma döngüsüdür: ön eğitim sırasında kayıp eğrilerini izlemek, kontrol noktalarını karşılaştırmak ve geliştiriciler açısından en kullanışlısı, bir sıkıştırma adımının hasar verip vermediğini denetlemek. Bir modeli kuantize edin ve kendi alanınızdan ayrılmış metin üzerinde öncesi ile sonrasında perplexity ölçün; değer neredeyse hiç oynamıyorsa sıkıştırma büyük olasılıkla modelin dil modelleme yeteneğini korumuştur, sıçrıyorsa pahalı bir görev düzeyi değerlendirmesi çalıştırmadan önce ucuz bir erken uyarı almışsınız demektir. Sayının bir anlam taşıyıp taşımadığını iki kısıt belirler. Birincisi, perplexity farklı tokenizer veya sözlük kullanan modeller arasında kıyaslanabilir değildir; çünkü metrik token başına tanımlıdır ve farklı tokenizer'lar aynı metni farklı sayıda token'a böler — dilinizi daha ince bölen bir tokenizer'a sahip model, hiçbir konuda daha iyi ya da daha kötü olmadan aynı metin için farklı bir perplexity gösterir. Bu, tokenizasyon verimliliğinin sağlayıcılar arasında büyük ölçüde değiştiği İngilizce dışı metinlerde en sert biçimde hissedilir. İkincisi, düşük perplexity aşağı akış davranışını güvenilir biçimde öngörmez: bir model bir sonraki token'ı tahmin etmekte mükemmel olup çok adımlı talimatları izlemekte, bir jailbreak'e direnmekte ya da olgusal kalmakta başarısız olabilir, çünkü bunların hiçbiri metriğin ölçtüğü şey değildir. Talimat ayarı ve tercih optimizasyonu gibi eğitim sonrası müdahaleler perplexity'yi bir yöne, kullanışlılığı ise diğer yöne bile taşıyabilir. Onu alttaki dil modelinin sağlık kontrolü olarak görün, asistanların sıralaması olarak değil — ve asla yayına aldığınız gerçek görevi değerlendirmenin yerine koymayın. Pratik bir kural: perplexity'yi mutlak bir kalite puanı gibi değil, kendi metninizde ölçülen bir fark sinyali gibi kullanın. Aynı tokenizer, aynı değerlendirme metni, aynı bağlam uzunluğu — ancak bu üçü sabitken iki ölçüm arasındaki değişim bir şey ifade eder.

İlgili terimler

Daha fazla Temel Yapay Zeka terimi