Иерархия инструкций (Instruction Hierarchy)

Иерархия инструкций — правило, по которому не весь текст, попадающий в LLM, обладает равной властью: политика платформы главнее системного промпта разработчика, тот главнее сообщений пользователя, а они главнее всего, что найдено в выводах инструментов или извлечённых документах. Понятие существует потому, что базовые модели относятся ко всем токенам одинаково — именно это эксплуатирует промпт-инъекция, когда вредоносное письмо или веб-страница говорит «игнорируй прежние инструкции». Провайдеры теперь явно обучают этому ранжированию (OpenAI опубликовала подход в 2024 году; обработка системного промпта у Claude следует тому же принципу): модели учатся отвергать текст с низкой привилегией, пытающийся переопределить правила с высокой. Практические выводы прямые: инварианты и правила безопасности — в системный промпт, а не в пользовательский ход; недоверенный контент помечайте явно (разделители, структурированные поля), чтобы модель могла его ранжировать; и помните, что иерархия — обученное поведение, а не жёсткая гарантия: сочетайте её с валидацией вывода и инструментами с минимальными правами.

Похожие термины

Ещё термины: Безопасность и соответствие