core-ai
Словарь ↗Обучение с подкреплением (RL)
Обучение с подкреплением — постановка, в которой модель учится, действуя и получая оценку, а не глядя на правильные ответы. Агент наблюдает состояние, совершает действие, получает награду и попадает в новое состояние; за множество эпизодов он выучивает политику — отображение состояний в действия, — которая набирает максимум награды. Правильный ход никто не размечает. Сигнал говорит лишь о том, хорошо ли всё сложилось, и часто приходит намного позже решения, которое было важным, — именно это делает RL и мощным, и неудобным. У этого неудобства есть имя: назначение заслуги. Если партия проиграна на шестидесятом ходу, какой из пятидесяти девяти предыдущих был ошибкой? RL тратит свой аппарат на ответ, и ответ этот статистический — поэтому RL требует несравнимо больше примеров, чем обучение с учителем. По той же причине его знаменитые успехи лежат в симуляции: игры, робототехнические стенды, маршрутизация трафика — там, где агент может провалиться миллион раз бесплатно. В живой бизнес-системе исследование означает сознательно делать выборы, которые вы ожидаете худшими, чтобы чему-то научиться, и это стоит реальных денег. Для большинства SaaS-команд значимость RL косвенная, но существенная: именно так выравнивают современные языковые модели. Обучение с подкреплением на человеческой обратной связи тренирует модель вознаграждения на человеческих предпочтениях между вариантами ответа, а затем через RL толкает языковую модель к тому, что эта модель вознаграждения одобряет. Прямая оптимизация предпочтений даёт похожий результат без отдельного RL-цикла. Оба подхода объясняют, почему сырая предобученная модель, просто продолжающая текст, превращается в ассистента, который отвечает на вопросы и отказывает во вредных просьбах. Словарь стоит носить с собой ради режимов отказа, которые он называет. Взлом вознаграждения — это политика, максимизирующая измеряемый сигнал вместо задуманного результата; в выровненных моделях он проявляется как многословие, оговорки и уверенный тон, то есть поведение, которое высоко оценила модель вознаграждения. Компромисс исследования и эксплуатации — то же напряжение, что стоит за A/B-тестами и бандитскими алгоритмами, и именно к этим соседям RL продуктовые команды тянутся на практике.
Похожие термины