Согласие между разметчиками

Согласие между разметчиками измеряет, как часто два и более человека независимо ставят одному и тому же примеру одну и ту же метку. Это проверка здоровья задачи разметки, и проводить её нужно до большой работы по аннотированию, а не после. Если двое обученных разметчиков расходятся на четверти примеров, значит недоопределена сама задача, и все дальнейшие цифры — точность обучения, оценки на тестах, сравнения моделей — унаследуют эту неоднозначность как шум, который не устранит никакая модель. Сырой процент совпадений приукрашивает картину: на сильно несбалансированном наборе двое разметчиков будут часто совпадать по чистой случайности. Стандартная альтернатива — статистики с поправкой на случайность: каппа Коэна для двух оценщиков, альфа Криппендорфа для большего числа; они показывают согласие сверх того, что дала бы случайная разметка того же распределения. Единого универсального порога нет, и называть его обычно ошибка: нужный уровень зависит от цены ошибки в вашем приложении. Правильная реакция на низкое согласие почти никогда не состоит в усреднении меток. Нужно прочитать расхождения, найти пересекающиеся категории или инструкцию, не покрывающую реальный случай, переписать руководство и измерить заново. В оценке языковых моделей та же дисциплина применима к моделям-судьям: прежде чем доверить модели выставлять оценки, проверьте её согласие с людьми на той же выборке и считайте разрыв доверительной погрешностью всех последующих оценок.

Похожие термины

Ещё термины: MLOps-процессы