Точность и полнота

Точность и полнота — две половины качества классификатора или поисковой подсистемы, и отвечают они на разные вопросы. Точность спрашивает: какая доля отмеченных системой объектов действительно верна? Полнота спрашивает: какую долю объектов, которые следовало отметить, система нашла? Спам-фильтр с высокой точностью почти не отправляет хорошие письма в мусор, но может пропускать спам; фильтр с высокой полнотой ловит почти весь спам, но изредка карантинит настоящий счёт. Аккуратность — доля всех верных предсказаний — этот компромисс скрывает и становится прямо обманчивой, когда один класс редок: модель, не отмечающая ничего, покажет 99% на задаче с долей события в 1% и не найдёт ничего. Компромисс обычно задаётся порогом, а не жёстким свойством. Снижение порога срабатывания повышает полноту и снижает точность; повышение делает обратное. Какую сторону предпочесть — вопрос продукта, а не моделирования: он зависит от того, чего стоит ложное срабатывание относительно пропуска в вашем процессе. Когда нужно одно число, F1 объединяет обе величины гармоническим средним, но отчёт только по F1 скрывает, в какую сторону компромисса сдвинулось изменение. В системах с поиском та же пара применима к этапу извлечения, где вначале важнее полнота — фрагмент, который не был найден, невозможно переранжировать, — а точность возвращают позже переранжированием.

Похожие термины

Ещё термины: MLOps-процессы