[{"data":1,"prerenderedAt":-1},["ShallowReactive",2],{"glossary-inter-annotator-agreement::ru":3,"gloss-cluster-inter-annotator-agreement::ru":26,"gloss-next-inter-annotator-agreement::ru":9},{"slug":4,"category":5,"name":6,"definition":7,"meta_desc":8,"faq":9,"schema_markup":9,"related":10},"inter-annotator-agreement","mlops","Согласие между разметчиками","Согласие между разметчиками измеряет, как часто два и более человека независимо ставят одному и тому же примеру одну и ту же метку. Это проверка здоровья задачи разметки, и проводить её нужно до большой работы по аннотированию, а не после. Если двое обученных разметчиков расходятся на четверти примеров, значит недоопределена сама задача, и все дальнейшие цифры — точность обучения, оценки на тестах, сравнения моделей — унаследуют эту неоднозначность как шум, который не устранит никакая модель. Сырой процент совпадений приукрашивает картину: на сильно несбалансированном наборе двое разметчиков будут часто совпадать по чистой случайности. Стандартная альтернатива — статистики с поправкой на случайность: каппа Коэна для двух оценщиков, альфа Криппендорфа для большего числа; они показывают согласие сверх того, что дала бы случайная разметка того же распределения. Единого универсального порога нет, и называть его обычно ошибка: нужный уровень зависит от цены ошибки в вашем приложении. Правильная реакция на низкое согласие почти никогда не состоит в усреднении меток. Нужно прочитать расхождения, найти пересекающиеся категории или инструкцию, не покрывающую реальный случай, переписать руководство и измерить заново. В оценке языковых моделей та же дисциплина применима к моделям-судьям: прежде чем доверить модели выставлять оценки, проверьте её согласие с людьми на той же выборке и считайте разрыв доверительной погрешностью всех последующих оценок.","Согласие между разметчиками показывает, одинаково ли люди размечают один пример, — проверка, от которой зависит, значит ли что-нибудь ваш тестовый набор.",null,[11,14,17,20,23],{"slug":12,"name":13},"data-labeling","Разметка данных",{"slug":15,"name":16},"golden-dataset","Золотой датасет",{"slug":18,"name":19},"llm-as-judge","LLM в роли судьи (LLM-as-Judge)",{"slug":21,"name":22},"pairwise-evaluation","Попарная оценка",{"slug":24,"name":25},"rubric-prompting","Rubric Prompting",[27,31,35,38,41,45,48,51,54,55,58,61],{"slug":28,"category":5,"name":29,"updated_at":30},"annotation-guidelines","Инструкции по разметке","2026-08-24T03:30:02+00:00",{"slug":32,"category":5,"name":33,"updated_at":34},"baseline-model","Базовая модель (baseline)","2026-08-24T02:46:38+00:00",{"slug":36,"category":5,"name":37,"updated_at":34},"batch-inference","Батч-инференс",{"slug":39,"category":5,"name":40,"updated_at":34},"canary-prompt","Канареечный промпт",{"slug":42,"category":5,"name":43,"updated_at":44},"champion-challenger","Чемпион–претендент (A\u002FB-тестирование моделей)","2026-08-24T02:46:37+00:00",{"slug":46,"category":5,"name":47,"updated_at":34},"class-imbalance","Дисбаланс классов",{"slug":49,"category":5,"name":50,"updated_at":34},"continuous-batching","Continuous Batching (непрерывная пакетная обработка)",{"slug":52,"category":5,"name":53,"updated_at":34},"cross-validation","Перекрёстная проверка",{"slug":12,"category":5,"name":13,"updated_at":34},{"slug":56,"category":5,"name":57,"updated_at":44},"drift-detection","Обнаружение дрейфа (Drift Detection)",{"slug":59,"category":5,"name":60,"updated_at":44},"eval-harness","Испытательный стенд оценки (Eval Harness)",{"slug":62,"category":5,"name":63,"updated_at":44},"experiment-tracking","Трекинг экспериментов (Experiment Tracking)"]