[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-pairwise-evaluation::tr":3,"gloss-cluster-pairwise-evaluation::tr":26,"gloss-next-pairwise-evaluation::tr":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"pairwise-evaluation","prompt-eng","İkili Değerlendirme","İkili değerlendirme (pairwise evaluation), model çıktılarını her birine mutlak bir not vermek yerine ikisini yan yana karşılaştırıp hangisinin daha iyi olduğunu sorarak puanlar. Hem insanlar hem LLM yargıçlar için bilinen bir gerçeğe dayanır: göreli yargılar ('A mı B mi?'), puanların kaydığı ve kümelendiği mutlak yargılardan ('bunu 1–10 arası puanla') çok daha tutarlıdır. Chatbot Arena bu kalıbı ölçekte popülerleştirdi — anonim modeller arasında ikili oylar toplayıp bunları Elo tarzı sıralamalara çevirerek. Geliştiriciler için 'yeni komutum ya da modelim gerçekten daha mı iyi oldu?' sorusunu güvenilir biçimde yanıtlamanın yoludur: değerlendirme setinizdeki her vaka için eski ve yeni çıktıları bir yargıca (ya da insana) gösterin, galibiyet, beraberlik ve mağlubiyetleri sayın. İki şeyi denetleyin: konum yanlılığı — yargıçlar ilk gelen cevabı kayırma eğilimindedir, bu yüzden sırayı değiştirip ortalayın — ve ikiden fazla seçeneği sıralamak için çok sayıda karşılaştırma gerektiğini unutmayın. Tek kırılgan bir ortalama yerine beraberlikleri de içeren galibiyet oranını raporlayın.","İkili değerlendirme, her çıktıya mutlak not vermek yerine ikisinden hangisinin daha iyi olduğunu sorar; göreli yargılar insan ve LLM yargıçlarda daha tutarlıdır.",null,[11,14,17,20,23],{"slug":12,"name":13},"golden-dataset","Altın Veri Kümesi",{"slug":15,"name":16},"llm-as-judge","Hakem Olarak LLM (LLM-as-Judge)",{"slug":18,"name":19},"position-bias","Konum Yanlılığı",{"slug":21,"name":22},"prompt-testing","Prompt Testi (İstem Testi)",{"slug":24,"name":25},"rubric-prompting","Rubric Prompting",[27,31,34,37,41,44,47,50,53,56,59,62],{"slug":28,"category":5,"name":29,"updated_at":30},"analogical-prompting","Analogical Prompting","2026-08-24T02:46:37+00:00",{"slug":32,"category":5,"name":33,"updated_at":30},"automatic-prompt-optimization","Otomatik Komut Optimizasyonu",{"slug":35,"category":5,"name":36,"updated_at":30},"chain-of-density","Yoğunluk Zinciri (CoD)",{"slug":38,"category":5,"name":39,"updated_at":40},"chain-of-thought-prompting","Chain-of-Thought Prompting (Düşünce Zinciri İstemi)","2026-08-24T02:46:36+00:00",{"slug":42,"category":5,"name":43,"updated_at":30},"chain-of-verification","Chain-of-Verification",{"slug":45,"category":5,"name":46,"updated_at":40},"chunking","Chunking (Parçalama)",{"slug":48,"category":5,"name":49,"updated_at":40},"constrained-decoding","Kısıtlanmış Çözümleme (Constrained Decoding)",{"slug":51,"category":5,"name":52,"updated_at":40},"context-stuffing","Bağlam Doldurma (Context Stuffing)",{"slug":54,"category":5,"name":55,"updated_at":40},"delimiter","Ayırıcı (Delimiter)",{"slug":57,"category":5,"name":58,"updated_at":30},"directional-stimulus-prompting","Directional Stimulus Prompting",{"slug":60,"category":5,"name":61,"updated_at":30},"emotion-prompting","Emotion Prompting",{"slug":63,"category":5,"name":64,"updated_at":40},"few-shot-prompting","Few-Shot Prompting (Az Örnekli İstem)"]