mlops
Sözlük ↗Değerlendirme Koşumu (Eval Harness)
Değerlendirme koşumu, model çıktıları için otomatik bir test takımıdır — makine öğreniminin birim testleri gibi düşünün. Sabit bir girdi veri kümesini puanlama mantığıyla eşleştirir: tam eşleşme kontrolleri, regex ya da şema doğrulaması, rubrik puanlaması veya her yanıtı derecelendiren bir LLM-hakem. Koşumu her istem değişikliğinde, model yükseltmesinde ya da ince ayarda çalıştırdığınızda içgüdü yerine karşılaştırılabilir bir skor elde edersiniz. Yapay zekâ özelliği yayınlayan SaaS geliştiricileri için bu, kendinden emin iterasyon ile 'umarım bir şey bozulmamıştır' arasındaki farktır. Koşum olmadan beş örneğe göz atar, yayınlar ve gerilemeyi öfkeli bir müşteriden öğrenirsiniz. Koşumla, vakaların %12'sini sessizce kötüleştiren bir istem değişikliği CI'da kırmızı bir sayı olarak belirir. Araçlar arasında promptfoo, OpenAI Evals, LangSmith ve Braintrust bulunur. Pratik not: gerçekten önem verdiğiniz yirmi-elli gerçek vakayla küçük başlayın, ucuz deterministik kontrolleri birkaç hakem tabanlı skorla harmanlayın ve üretime her bir hata kaçtığında kümeyi büyütün.
İlgili terimler