Directional Stimulus Prompting

Directional stimulus prompting (DSP, «направляющий стимул») управляет крупной, часто «чёрным ящиком», моделью, впрыскивая в промпт небольшие точечные подсказки — «стимул», — например ключевые слова, которые вывод должен включить или подчеркнуть. Изюминка метода (Li et al., 2023) в том, что для автоматической генерации этих подсказок под каждый вход обучают гораздо меньшую настраиваемую policy-модель, так что вы влияете на поведение замороженной LLM, не дообучая её. В оригинальной работе генерация ключевых подсказок подталкивала резюме охватывать важные пункты и улучшала соответствие эталонным резюме. Для SaaS-разработчиков повседневный вывод — сам приём: добавление компактной направляющей подсказки («подчеркни цены и интеграции»; «включи эти сущности») — дешёвый способ склонить вывод к нужному, не переписывая всю инструкцию. Полноценная версия с обученной policy — более тяжёлая инженерия и оправдана в основном тогда, когда вы вызываете закрытый API, который нельзя дообучить, но нужен управляемый, соответствующий бренду вывод в масштабе. Для более простых задач написанные вручную стимулы дают большую часть пользы.

Похожие термины

Ещё термины: Промпт-инжиниринг