prompt-eng
Словарь ↗Инструктивное дообучение (Instruction Tuning)
Инструктивное дообучение — это процесс дообучения, применяемый разработчиками моделей (обычно не самими разработчиками SaaS напрямую), в котором базовая языковая модель — предобученная исключительно для предсказания следующего токена на огромных объёмах интернет-текста — дополнительно обучается на курируемом наборе данных пар «инструкция-ответ» (промпт, описывающий задачу, в паре с качественным ответом, который корректно её выполняет), чтобы модель научилась надёжно интерпретировать и следовать инструкциям на естественном языке, а не просто продолжать текст стилистически правдоподобным образом. Этот шаг — критическое различие между сырой базовой моделью, которая склонна продолжать промпт в статистически вероятном направлении (иногда полностью игнорируя инструкцию и просто расширяя текст, будто это документ), и «инструктивной» или «чат»-моделью, специально обученной распознавать «это задача, которую я должна выполнить», и отвечать полезно и прямо. Каждая потребительская чат-модель (Claude, ChatGPT, Gemini) прошла через инструктивное дообучение (как правило, в сочетании с дальнейшими техниками выравнивания, такими как RLHF или Constitutional AI) — именно поэтому эти модели надёжно отвечают на «Резюмируй эту статью» реальным резюме, а не продолжением текста, будто пишут более длинную статью. Для разработчиков SaaS инструктивное дообучение в основном актуально как фоновое знание, объясняющее, почему промпт-инжиниринг работает именно так: поскольку модели обучены распознавать и следовать инструкциям, хорошо сформулированные, явные инструкции в промпте гораздо надёжнее расплывчатых предложений, и понимание этого процесса обучения помогает объяснить наблюдаемое поведение модели — например, почему модели заметно лучше реагируют на промпты, сформулированные как чёткие директивы («Извлеки итоговую сумму из этого счёта»), чем на неявные или окольные формулировки («Интересно, какая итоговая сумма может быть в этом счёте»). Это отличается от самого промпт-инжиниринга (который происходит во время инференса, с фиксированной моделью) и от дальнейшего кастомного дообучения (которое SaaS-компания может выполнить поверх уже инструктивно дообученной модели, чтобы ещё больше специализировать её для узкой задачи). Разобранный пример: базовая (не прошедшая инструктивное дообучение) модель, получив промпт «Переведи следующее на французский: Hello, how are you?», может ответить, продолжая списком дополнительных примеров переводов («Переведи следующее на испанский: ...»), а не фактически выдав французский перевод, потому что она сопоставляет паттерн «это похоже на список упражнений по переводу», а не распознаёт задачу для выполнения. Тот же промпт, отправленный инструктивно дообученной модели вроде Claude, надёжно возвращает напрямую «Bonjour, comment allez-vous?», потому что инструктивное дообучение специально научило модель распознавать формулировку задачи в повелительном наклонении и отвечать выполнением задачи, а не продолжением паттерна.
Похожие термины