[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-offline-evaluation::tr":3,"gloss-cluster-offline-evaluation::tr":26,"gloss-next-offline-evaluation::tr":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"offline-evaluation","mlops","Çevrimdışı Değerlendirme","Çevrimdışı değerlendirme, bir modeli, promptu ya da hattı kullanıcılara ulaşmadan önce sabit bir veri kümesine karşı puanlama pratiğidir. Girdiler sabit tutulur, test edilen sistem değiştirilir ve sonuçlar karşılaştırılır. Canlı trafikle ve gerçek insanlarla davranışı ölçen çevrimiçi değerlendirmenin karşılığıdır; ikisi farklı soruları yanıtlar: çevrimdışı bir değişikliği yayımlamanın güvenli olup olmadığını, çevrimiçi ise yayımlamanın değip değmediğini söyler.\n\nDeğeri tekrarlanabilir olmasından gelir. Veri kümesi yerinden oynamadığı için iki koşu karşılaştırılabilir, bir gerileme belirli bir değişikliğe atfedilebilir ve başarısız bir vaka istendiği anda yeniden üretilebilir. Çevrimdışı değerlendirmeyi dağıtım hattının doğal kapısı yapan da budur: sabit kümede doğruluğu düşüren bir prompt düzenlemesi bir olaya dönüşmeden engellenebilir ve aynı küme aday bir modelde koşturulduğunda göç, bir inanç sıçraması olmaktan çıkıp bir ölçüme dönüşür.\n\nKalite veri kümesinde yaşar. Küme hayal edilmiş örneklerden değil gerçek trafikten çıkarılmalı, asıl önemli vakalara ağırlık vermeli ve kasıtlı olarak zor olanlarla doldurulmalıdır: belirsiz istekler, düşmanca girdiler, iyi bir yanıtı olmayan sorular ve geçmişteki her üretim hatası. Yalnızca temiz girdiler içeren bir test kümesi, kimsenin kullanmadığı bir sistemi ölçer. Her olay bu kümeye eklenen bir satırla bitmelidir; değerlendirmeyi bir ritüel olmaktan çıkarıp bir cırcır dişlisine çeviren şey budur.\n\nDiğer yarısı puanlamadır. Belirlenimci denetimler ucuzdur ve yükün olabildiğince büyük kısmını taşımalıdır: çıktı ayrıştırılıyor mu, şemayı karşılıyor mu, zorunlu alanı içeriyor mu, var olan bir kaynağa atıf yapıyor mu. Geriye kalan yargıdır ve ya yazılı bir ölçüte göre insan değerlendiriciler ya da yargıç rolündeki bir model tarafından puanlanır; ikincisi ölçeklenir ama kararlarına güvenilmeden önce insan etiketlerine karşı kendi doğrulamasını ister.\n\nAsıl risk, sayıyı gerçeğin kendisi saymaktır. Çevrimdışı puan bir vekildir: kümede yakalanmış dağılımdaki başarımı ölçer ve o dağılım, ürün değiştikçe ve kullanıcılar sistemin nelerde iyi olduğunu öğrendikçe canlı trafikten uzaklaşır. Hiç tazelenmeyen bir küme yavaşça sistemin geçmeyi öğrendiği bir sınava dönüşür; şüpheli ölçüde yüksek bir puan ise genellikle örneklerin promptlara sızdığı ya da kümenin güncel hiçbir şeyi temsil etmediği anlamına gelir.\n\nBunu bir olay gibi değil bir test takımı gibi işletin. Veri kümesini kodla birlikte sürümleyin, promptlarda, getirmede veya model yapılandırmasında her değişiklikte değerlendirmeyi koşturun, sonuçları onları üreten commit'in yanında saklayın ve puanı düşüren her şeyin yayımlanması için bilinçli bir karar şartı koyun. Amaç hedef bir sayıya ulaşmak değil, istemediğiniz bir değişikliği fark etmektir.","Çevrimdışı değerlendirme, bir modeli veya promptu yayına çıkmadan sabit bir veri kümesinde puanlar. Tekrarlanabilirdir ve kullanıcı deneyiminin bir vekilini ölçer.",null,[11,14,17,20,23],{"slug":12,"name":13},"eval-harness","Değerlendirme Koşumu (Eval Harness)",{"slug":15,"name":16},"golden-dataset","Altın Veri Kümesi",{"slug":18,"name":19},"llm-as-judge","Hakem Olarak LLM (LLM-as-Judge)",{"slug":21,"name":22},"regression-testing","Regresyon Testi (Regression Testing)",{"slug":24,"name":25},"shadow-deployment","Gölge Dağıtım (Shadow Deployment)",[27,31,35,38,41,45,48,51,54,57,60,61],{"slug":28,"category":5,"name":29,"updated_at":30},"annotation-guidelines","Etiketleme Kılavuzu","2026-08-24T03:30:02+00:00",{"slug":32,"category":5,"name":33,"updated_at":34},"baseline-model","Temel Model (Baseline)","2026-08-24T02:46:38+00:00",{"slug":36,"category":5,"name":37,"updated_at":34},"batch-inference","Toplu Çıkarım",{"slug":39,"category":5,"name":40,"updated_at":34},"canary-prompt","Kanarya Prompt",{"slug":42,"category":5,"name":43,"updated_at":44},"champion-challenger","Şampiyon-Meydan Okuyan (A\u002FB Model Testi)","2026-08-24T02:46:37+00:00",{"slug":46,"category":5,"name":47,"updated_at":34},"class-imbalance","Sınıf Dengesizliği",{"slug":49,"category":5,"name":50,"updated_at":34},"continuous-batching","Sürekli Toplu İşleme (Continuous Batching)",{"slug":52,"category":5,"name":53,"updated_at":34},"cross-validation","Çapraz Doğrulama",{"slug":55,"category":5,"name":56,"updated_at":34},"data-labeling","Veri Etiketleme",{"slug":58,"category":5,"name":59,"updated_at":44},"drift-detection","Sapma Tespiti (Drift Detection)",{"slug":12,"category":5,"name":13,"updated_at":44},{"slug":62,"category":5,"name":63,"updated_at":44},"experiment-tracking","Deney Takibi (Experiment Tracking)"]