core-ai
Словарь ↗Конституционный ИИ (Constitutional AI)
Конституционный ИИ — техника выравнивания, разработанная Anthropic, при которой модель обучается критиковать и переписывать собственные ответы, сверяясь с письменным набором принципов — «конституцией», — а не полагается только на людей, размечающих каждый вредный или бесполезный вывод. Модель генерирует ответ, проверяет его по принципам, переписывает, и эти самоисправления становятся обучающим сигналом; на более позднем этапе значительная часть настройки безопасности использует предпочтения, сгенерированные ИИ (RLAIF), а не оценки людей. Модели Claude от Anthropic обучаются именно так. Для разработчиков это полезная ментальная модель того, как современные ассистенты обретают своё поведение и границы: правила, которым следует модель, можно сделать явными и проверяемыми, а не спрятанными в миллионах человеческих меток. Практическая заметка: конституцию размещённой модели вы отредактировать не можете, но можете формировать поведение на своём уровне через чёткий системный промпт, излагающий ваши принципы и приоритеты, — считайте его облегчённой конституцией вашего приложения. Стоит заранее снять два неверных прочтения. Конституцию не подают модели как системный промпт во время обычной работы — это прежде всего техника этапа обучения, формирующая усвоенное поведение, а не документ, к которому модель обращается на инференсе; поэтому её нельзя ни просмотреть, ни переопределить из вызова API так, как вы это делаете со своими инструкциями. И безупречного следования каждому заявленному принципу она не гарантирует. Как всякий метод выравнивания, она снижает нежелательное поведение, но не устраняет его: обученная так модель по-прежнему непоследовательно отказывает на краевых случаях и по-прежнему сбивается с политики упорным джейлбрейком. Что подход действительно даёт — это масштаб и проверяемость. Поскольку значительная часть разметки предпочтений порождается ИИ, следующим письменным принципам, а не людьми-оценщиками — семейство техник, известное как RLAIF, — узкое место разметки, сдерживающее чисто человеческую обратную связь, во многом исчезает, а вместе с ним падают и стоимость, и календарный срок обучения безопасности. А поскольку принципы записаны, их можно прочитать, оспорить и пересмотреть: это заметно иная история подотчётности, чем миллионы непрозрачных человеческих суждений о предпочтениях, которые постфактум не исследуешь. Очевидная зависимость в том, что качество теперь опирается на собственное суждение направляющей модели и на чёткость формулировок конституции: расплывчатый или неудачно выбранный принцип тиражируется в масштабе, вместо того чтобы усредниться среди множества независимых оценщиков. Не исчезает и человеческий надзор — конституцию по-прежнему пишут люди, и результаты аудируют тоже они. Практический вывод для вашего собственного слоя таков: пишите принципы коротко, по порядку и без внутренних противоречий. Несколько ясных приоритетов с указанием, какой из них побеждает при конфликте, соблюдать намного легче — и модели, и вашей команде, — чем длинный перечень запретов.
Похожие термины