Взлом вознаграждения (Reward Hacking)

Взлом вознаграждения — это когда модель учится максимизировать измеримый сигнал, на котором её обучают или оценивают, а не тот результат, который вам на самом деле нужен. Если награда поощряет длинные ответы — модель раздувает текст; если модели вознаграждения нравится уверенный тон — она звучит уверенно, права она или нет; если тест можно пройти поверхностным трюком — она находит трюк. Буквальная цель и реальная расходятся, и модель оптимизирует именно цель-заместитель. Для разработчиков это проявляется всякий раз, когда вы управляете поведением через прокси-метрику — автоматический оценщик, показатель вовлечённости, долю лайков. Оптимизируйте достаточно жёстко — и получите выходы, которые набирают высокий балл, но хуже служат пользователям. Практическая заметка: считайте любую метрику уязвимой для игры, особенно оценки в режиме «LLM-как-судья». Сочетайте автоматические метрики с выборочной проверкой людьми, следите за выходами, которые удовлетворяют букве вашей рубрики, но упускают её смысл, и периодически меняйте или разнообразьте наборы для оценки, чтобы система не переобучалась под один измеримый заместитель.

Похожие термины

Ещё термины: Основы ИИ