Руководство · fundamentals

Что такое дообучение модели и когда оно действительно нужно

Дообучение адаптирует поведение модели, тренируя её на ваших примерах. Это руководство объясняет, что оно делает хорошо, чего не может и почему большинство задач, ради которых за него берутся, решаются поиском по вашим данным или более точным промптом.

Автор stackzen-desk · Editorial reviews deskОбновлено 10 августа 2026 г.

Что дообучение делает на самом деле

Дообучение берёт модель, уже обученную на очень большом корпусе, и продолжает её обучение на гораздо меньшем наборе ваших собственных примеров. Каждый пример — это пара: вход и желаемый выход. После достаточного их числа поведение модели по умолчанию смещается к образцу из ваших данных. В процессе нет ничего загадочного и ничего магического: вы подталкиваете веса, которые уже сформированы объёмом текста на порядки большим, чем вы когда-либо предоставите.

Различие, которое экономит больше всего денег

Дообучение отлично учит модель тому, как отвечать, и сравнительно плохо — тому, что является правдой. Формат, тон, структура, устойчивая таксономия, фирменный стиль, узкое классификационное решение — это поведение, и несколько сотен грамотно подобранных примеров способны заметно его сдвинуть. Факты о вашем продукте, клиентах или изменении правил на прошлой неделе — задача другого рода. Они меняются, их много, а модель, впитавшая их в веса, не сможет сказать, откуда взялся ответ, и не поддаётся исправлению без нового прогона обучения.

Поэтому стандартный ответ для знаний — поиск: держите факты в системе, которую можно обновлять, доставайте нужные в момент запроса и кладите их в промпт. Эти два подхода не соперники. Боевая функция часто дообучается ради формы ответа и использует поиск ради его содержания.

Сначала попробуйте более дешёвое, по порядку

Большинство команд, считающих, что им нужно дообучение, не исчерпали альтернативы. Пройдите их в порядке стоимости. Первое — более ясный промпт: явное описание задачи, аудитории и формата вывода снимает больше проблем, чем что бы то ни было ещё, и стоит одного вечера. Второе — примеры внутри промпта: показать три-четыре идеальных ответа это самый быстрый способ объяснить формат. Третье — поиск по вашим данным, если сбои связаны с нехваткой знаний. Четвёртое — декомпозиция: разбить один промпт, делающий три вещи, на три вызова по одной обычно выигрывает у любого объёма дообучения.

Только когда и этого мало, дообучение становится правильным рычагом — как правило, если поведение должно быть одинаковым на тысячах вызовов, если инструкция, необходимая для достижения того же промптом, выросла настолько, что стоит реальных денег на каждом запросе, или если вы хотите поручить узкую работу модели поменьше и подешевле вместо нынешней большой.

Во что это обходится помимо счёта за обучение

Вычисления — обычно самая маленькая строка. Настоящая работа это набор данных: примеры нужно собрать, вычистить, привести к единообразию и удерживать в стандарте, потому что модель, обученная на противоречивых примерах, учится быть непоследовательной. Нужна отложенная выборка, на которой вы никогда не обучаетесь, иначе не будет способа понять, стала дообученная модель лучше или просто другой. И дообученная модель — это новый артефакт во владении: у него есть версия, его нужно переоценивать при каждом обновлении базовой модели, и он может тихо стать причиной, по которой вы не сможете перейти на более новую и дешёвую модель позже.

Как решать конкретно

Запишите сбой, который хотите устранить, одним предложением и с тремя реальными примерами. Затем спросите, к какой категории он относится. Если модель чего-то не знает — это поиск. Если знает, но отвечает не в той форме — сначала промпт и примеры, потом дообучение. Если модель права, но слишком медленна или дорога, дообучение модели поменьше это законный ответ. Если у сбоев нет описуемой закономерности, никакое дообучение не поможет, потому что нельзя собрать набор данных под цель, которую вы не можете сформулировать.

Если всё-таки беретесь

Начинайте не с обучающих данных, а с набора для оценки — несколько десятков реалистичных входов и ответы, которые вы бы приняли, оцениваемые всегда одинаково. Без него вы будете сравнивать впечатления. Держите обучающий набор сначала небольшим и смотрите, двигается ли кривая; большой датасет, собранный до появления сигнала, — это долгий крюк. Записывайте, какая базовая модель, версия данных и настройки дали каждую дообученную модель, потому что её придётся воспроизводить. И периодически прогоняйте оценку против обычной базовой модели: честный итог многих проектов дообучения в том, что более новая общая модель догнала, а поддерживаемый артефакт больше не окупает себя.

Ещё гайды