Getirme Değerlendirmesi

Getirme değerlendirmesi, bir RAG sisteminin getirme aşamasını kendi ölçütleriyle ölçme pratiğidir — doğru pasajlar geri geldi mi ve üst sıralara yakın mı sıralandı — ve bu, modelin ardından yazdığı yanıtın değerlendirilmesinden ayrıdır. Bu ayrım işin bütün özüdür. Bir RAG uygulaması yanlış yanıt verdiğinde iki çok farklı neden vardır: gerekli bilgi hiç getirilmemiştir ya da getirilmiş ama model onu yok saymış veya yanlış okumuştur. Bunların düzeltmeleri birbirinin tersidir ve uçtan uca bir yanıt skoru ikisini ayırt edemez; bu yüzden yalnızca nihai çıktıyı ölçen ekipler, bir parçalama sorununu onarmak için prompt ayarlamaya çalışır. Temel ölçümler recall@k, precision@k ve ortalama karşılıklı sıra ya da normalleştirilmiş DCG gibi sıraya duyarlı bir metriktir. Recall@k, soruyu yanıtlamak için gereken pasajların ilk k sonuç içinde herhangi bir yerde görünüp görünmediğini sorar ve tüm sisteme tavan koyan metrik budur: bağlam penceresine hiç girmeyen bilgi, model ne kadar iyi olursa olsun kullanılamaz. Precision@k, geri gelenin ne kadarının gerçekten ilgili olduğunu sorar; bu önemlidir çünkü ilgisiz bağlam bedava değildir — bütçeyi tüketir, dikkati seyreltir ve modele kendinden emin biçimde yanılabileceği malzeme verir. Sıraya duyarlı metrikler, gerçekçi olarak yalnızca ilk birkaç pasajın okunduğu durumlarda önem kazanır. Bütün bunlar etiketli bir küme gerektirir: sorulara, onları gerçekten yanıtlayan pasajların eşlendiği ve uydurma değil gerçek kullanıcı sorgularından kurulmuş bir küme. Elli ile birkaç yüz arasında iyi seçilmiş örnek, gerilemeleri yakalamak için genellikle yeterlidir ve bu kümeyi kurmak, ekiplerin atladığı ve sonradan pişman olduğu adımdır. Bu tür bir değerlendirme, getirme değişikliklerini tartışılır olmaktan çıkarıp karara bağlanabilir kılar; çünkü parça boyutu, örtüşme, gömme modeli, hibrit ağırlıklandırma ve yeniden sıralayıcı, etkileri onsuz görünmeyen ayar düğmeleridir. Pratik not: değerlendirme kümesini kodun yanında sürüm kontrolüne sabitleyin ve parçalama, gömmeler veya getirme sorgusundaki her değişiklikte CI içinde yeniden çalıştırın; ayrıca indeksi hangi gömme modelinin ürettiğini mutlaka kaydedin — farklı modellerin vektörleri karşılaştırılabilir değildir, dolayısıyla sessiz bir model yükseltmesi hem indeksi hem de ona karşı ölçtüğünüz her sayıyı geçersiz kılar.

İlgili terimler

Daha fazla MLOps Süreçleri terimi