[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-llm-as-judge::ru":3,"gloss-cluster-llm-as-judge::ru":20,"gloss-next-llm-as-judge::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"llm-as-judge","prompt-eng","LLM в роли судьи (LLM-as-Judge)","LLM в роли судьи (LLM-as-judge) — это техника оценки, при которой сама большая языковая модель используется для оценки, критики или сравнения выводов другого вызова модели (или двух разных версий промпта, применённых к одному и тому же входу) согласно определённой рубрике, заданной в промпте самого судьи, — специализированное применение паттерна мета-промпта, используемое конкретно для автоматизации оценки качества в масштабе, недостижимом для ручной проверки человеком. Это стало одним из важнейших инструментов в продакшен-промпт-инжиниринге и рабочих процессах разработки ИИ-продуктов, потому что традиционное тестирование ПО (утверждения точного совпадения) плохо работает для свободного текста, недетерминированного вывода LLM — два правильных резюме одного и того же документа могут быть сформулированы совершенно по-разному, поэтому нельзя просто утверждать «вывод равен ожидаемой строке». LLM-как-судья заполняет этот пробел, используя собственную способность модели понимать язык для оценки более нюансированных качеств: фактическую точность относительно эталона, соответствие заданному тону или формату, полезность, лаконичность, или прямое сравнение двух кандидатских выводов («Ответ A против Ответа B: какой лучше отвечает на вопрос пользователя? Ответь A, B или НИЧЬЯ»). Используется для попарного сравнения (решение, лучше ли новая версия промпта текущей продакшен-версии на наборе оценки), абсолютной оценки (оценка одного вывода по шкале 1-10 согласно рубрике, полезно для отслеживания трендов качества со временем) и оценки на основе эталона (сравнение ответа модели с известным правильным ответом для задач фактической точности). Хорошо известное ограничение состоит в том, что у судей-LLM есть собственные предвзятости — тенденция отдавать предпочтение более длинным ответам (предвзятость к многословности), отдавать предпочтение ответам, похожим на собственный стиль письма судьи (предвзятость самопредпочтения, когда судья и генератор — одно семейство моделей), и позиционная предвзятость в попарных сравнениях (предпочтение того ответа, который представлен первым) — поэтому зрелые схемы оценки рандомизируют порядок ответов, периодически валидируют оценки судьи по выборке реальных человеческих оценок и иногда используют другую, как правило более сильную модель в качестве судьи, чем оцениваемая, чтобы снизить предвзятость самопредпочтения. Разобранный пример: команда, поддерживающая генератор ответов на клиентские письма с ИИ, хочет сравнить новую версию промпта с текущей продакшен-версией на 300 исторических обращениях в поддержку перед принятием решения о выкатке. Ручное прочтение 600 пар ответов непрактично для рутинного изменения промпта, поэтому они строят оценку LLM-как-судья: «Дано это обращение клиента и два кандидатских ответа агента, оцени каждый по шкале 1-10 по полезности и профессионализму, затем укажи, какой лучше в целом. ОБРАЩЕНИЕ: {{ticket}}. ОТВЕТ A: {{response_a}}. ОТВЕТ B: {{response_b}}». Запущенный на всех 300 парах с рандомизированным порядком ответов для контроля позиционной предвзятости, новый вариант побеждает со счётом 214-86 — результат, дающий команде количественную, масштабируемую уверенность для выкатки, выборочно сверенный с выборкой из 20 обращений, проверенных человеком, чтобы подтвердить, что оценка судьи соответствует реальной человеческой оценке качества.","LLM-как-судья использует одну модель ИИ для оценки, выставления баллов или сравнения выводов другой модели ИИ (или промпта) по заданной рубрике.",null,[11,14,17],{"slug":12,"name":13},"meta-prompt","Мета-промпт",{"slug":15,"name":16},"prompt-versioning","Версионирование промптов",{"slug":18,"name":19},"self-consistency","Self-consistency (самосогласованность)",[21,25,28,31,35,38,41,44,47,50,53,56],{"slug":22,"category":5,"name":23,"updated_at":24},"analogical-prompting","Analogical Prompting","2026-08-24T02:46:37+00:00",{"slug":26,"category":5,"name":27,"updated_at":24},"automatic-prompt-optimization","Автоматическая оптимизация промптов",{"slug":29,"category":5,"name":30,"updated_at":24},"chain-of-density","Цепочка плотности (CoD)",{"slug":32,"category":5,"name":33,"updated_at":34},"chain-of-thought-prompting","Chain-of-thought-промптинг (промптинг с цепочкой рассуждений)","2026-08-24T02:46:36+00:00",{"slug":36,"category":5,"name":37,"updated_at":24},"chain-of-verification","Chain-of-Verification",{"slug":39,"category":5,"name":40,"updated_at":34},"chunking","Чанкинг (Chunking)",{"slug":42,"category":5,"name":43,"updated_at":34},"constrained-decoding","Ограниченное декодирование (Constrained Decoding)",{"slug":45,"category":5,"name":46,"updated_at":34},"context-stuffing","Переполнение контекста (Context Stuffing)",{"slug":48,"category":5,"name":49,"updated_at":34},"delimiter","Разделитель (Delimiter)",{"slug":51,"category":5,"name":52,"updated_at":24},"directional-stimulus-prompting","Directional Stimulus Prompting",{"slug":54,"category":5,"name":55,"updated_at":24},"emotion-prompting","Emotion Prompting",{"slug":57,"category":5,"name":58,"updated_at":34},"few-shot-prompting","Few-shot-промптинг (промптинг с примерами)"]