[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-eval-harness::ru":3,"gloss-cluster-eval-harness::ru":26,"gloss-next-eval-harness::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"eval-harness","mlops","Испытательный стенд оценки (Eval Harness)","Eval harness — это автоматический набор тестов для выходов модели, аналог юнит-тестов в машинном обучении. Он соединяет фиксированный набор входных данных с логикой оценивания: проверки на точное совпадение, валидация по regex или схеме, оценка по рубрике или LLM-судья, который выставляет балл каждому ответу. Запуская стенд при каждой правке промпта, обновлении модели или дообучении, вы получаете сопоставимый балл вместо ощущения «на глаз». Для SaaS-команд, выпускающих AI-функции, это разница между уверенной итерацией и молитвой, чтобы ничего не сломалось. Без стенда вы смотрите на пять примеров, релизите и узнаёте о регрессии от разгневанного клиента. Со стендом правка промпта, которая тихо ухудшает 12% случаев, всплывает красным числом в CI. Среди инструментов — promptfoo, OpenAI Evals, LangSmith и Braintrust. Практическая заметка: начните с малого — двадцати-пятидесяти реальных случаев, которые вам действительно важны, смешайте дешёвые детерминированные проверки с несколькими оценками судьи и расширяйте набор всякий раз, когда баг прорывается в продакшен.","Eval harness — набор юнит-тестов для выходов модели: фиксированный датасет плюс оценка (точное совпадение, схема, рубрика, LLM-судья) на каждое изменение.",null,[11,14,17,20,23],{"slug":12,"name":13},"ci-cd","Непрерывная интеграция \u002F непрерывное развёртывание (CI\u002FCD)",{"slug":15,"name":16},"golden-dataset","Золотой датасет",{"slug":18,"name":19},"llm-as-judge","LLM в роли судьи (LLM-as-Judge)",{"slug":21,"name":22},"llm-benchmark","Бенчмарк LLM (LLM Benchmark)",{"slug":24,"name":25},"prompt-testing","Тестирование промптов (Prompt Testing)",[27,31,35,38,41,45,48,51,54,57,60,63],{"slug":28,"category":5,"name":29,"updated_at":30},"annotation-guidelines","Инструкции по разметке","2026-08-24T03:30:02+00:00",{"slug":32,"category":5,"name":33,"updated_at":34},"baseline-model","Базовая модель (baseline)","2026-08-24T02:46:38+00:00",{"slug":36,"category":5,"name":37,"updated_at":34},"batch-inference","Батч-инференс",{"slug":39,"category":5,"name":40,"updated_at":34},"canary-prompt","Канареечный промпт",{"slug":42,"category":5,"name":43,"updated_at":44},"champion-challenger","Чемпион–претендент (A\u002FB-тестирование моделей)","2026-08-24T02:46:37+00:00",{"slug":46,"category":5,"name":47,"updated_at":34},"class-imbalance","Дисбаланс классов",{"slug":49,"category":5,"name":50,"updated_at":34},"continuous-batching","Continuous Batching (непрерывная пакетная обработка)",{"slug":52,"category":5,"name":53,"updated_at":34},"cross-validation","Перекрёстная проверка",{"slug":55,"category":5,"name":56,"updated_at":34},"data-labeling","Разметка данных",{"slug":58,"category":5,"name":59,"updated_at":44},"drift-detection","Обнаружение дрейфа (Drift Detection)",{"slug":61,"category":5,"name":62,"updated_at":44},"experiment-tracking","Трекинг экспериментов (Experiment Tracking)",{"slug":64,"category":5,"name":65,"updated_at":34},"explainability","Объяснимость"]