[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-pairwise-evaluation::ru":3,"gloss-cluster-pairwise-evaluation::ru":26,"gloss-next-pairwise-evaluation::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"pairwise-evaluation","prompt-eng","Попарная оценка","Попарная оценка (pairwise evaluation) оценивает выводы модели, сравнивая два из них напрямую и спрашивая, какой лучше, вместо выставления каждому абсолютной оценки. Она опирается на известный факт о людях и LLM-судьях: относительные суждения («A или B?») куда стабильнее абсолютных («оцени от 1 до 10»), где оценки плывут и слипаются. Chatbot Arena популяризировала подход в масштабе — собирая попарные голоса между анонимными моделями и превращая их в рейтинги в стиле Elo. Для разработчиков это надёжный способ ответить на вопрос «мой новый промпт или модель реально стали лучше?»: покажите судье (или человеку) старый и новый вывод для каждого случая из набора оценки и посчитайте победы, ничьи и поражения. Контролируйте две вещи: позиционное смещение — судьи склонны предпочитать ответ, идущий первым, поэтому меняйте порядок и усредняйте, — и то, что для ранжирования более чем двух вариантов нужно много сравнений. Сообщайте долю побед с учётом ничьих, а не одну хрупкую усреднённую оценку.","Попарная оценка спрашивает, какой из двух выводов лучше, вместо абсолютных баллов: относительные суждения намного стабильнее и у людей, и у LLM-судей.",null,[11,14,17,20,23],{"slug":12,"name":13},"golden-dataset","Золотой датасет",{"slug":15,"name":16},"llm-as-judge","LLM в роли судьи (LLM-as-Judge)",{"slug":18,"name":19},"position-bias","Позиционное смещение",{"slug":21,"name":22},"prompt-testing","Тестирование промптов (Prompt Testing)",{"slug":24,"name":25},"rubric-prompting","Rubric Prompting",[27,31,34,37,41,44,47,50,53,56,59,62],{"slug":28,"category":5,"name":29,"updated_at":30},"analogical-prompting","Analogical Prompting","2026-08-24T02:46:37+00:00",{"slug":32,"category":5,"name":33,"updated_at":30},"automatic-prompt-optimization","Автоматическая оптимизация промптов",{"slug":35,"category":5,"name":36,"updated_at":30},"chain-of-density","Цепочка плотности (CoD)",{"slug":38,"category":5,"name":39,"updated_at":40},"chain-of-thought-prompting","Chain-of-thought-промптинг (промптинг с цепочкой рассуждений)","2026-08-24T02:46:36+00:00",{"slug":42,"category":5,"name":43,"updated_at":30},"chain-of-verification","Chain-of-Verification",{"slug":45,"category":5,"name":46,"updated_at":40},"chunking","Чанкинг (Chunking)",{"slug":48,"category":5,"name":49,"updated_at":40},"constrained-decoding","Ограниченное декодирование (Constrained Decoding)",{"slug":51,"category":5,"name":52,"updated_at":40},"context-stuffing","Переполнение контекста (Context Stuffing)",{"slug":54,"category":5,"name":55,"updated_at":40},"delimiter","Разделитель (Delimiter)",{"slug":57,"category":5,"name":58,"updated_at":30},"directional-stimulus-prompting","Directional Stimulus Prompting",{"slug":60,"category":5,"name":61,"updated_at":30},"emotion-prompting","Emotion Prompting",{"slug":63,"category":5,"name":64,"updated_at":40},"few-shot-prompting","Few-shot-промптинг (промптинг с примерами)"]