Предобучение

Предобучение — первый и самый дорогой этап создания языковой модели: базовая сеть обучается на очень большом и разнородном корпусе с одной простой задачей — предсказать следующий токен — пока не усвоит грамматику, факты, код и значительную часть скрытых способностей к рассуждению. Всё, что происходит потом (обучение на инструкциях, оптимизация по предпочтениям, выравнивание по безопасности), лишь перестраивает поведение, уже заложенное предобучением; ни один из этих этапов не добавляет знаний в сопоставимом объёме. Этот порядок объясняет несколько вещей, с которыми сталкиваются разработчики. Модель не может надёжно отвечать на вопросы о материале, которого не было в корпусе предобучения — отсюда и граница знаний, и то, что стандартное решение это поиск и подстановка контекста, а не дополнительная донастройка. Донастройка меняет стиль, формат и следование задаче гораздо легче, чем состав знаний, потому что её датасет на порядки меньше корпуса предобучения. Структура затрат тоже несимметрична: предобучение — капитальный проект, измеряемый кластеро-месяцами, а адаптация готовой модели по силам небольшой команде. Для почти любого SaaS-продукта вопрос не в том, проводить ли предобучение, а в том, какую готовую базовую модель взять и чем закрывать остаток разрыва: промптами, поиском или лёгкой адаптацией. Предобучение с нуля оправдано в основном тогда, когда словарь предметной области действительно не похож на публичные тексты или когда данные вообще не могут покинуть контур компании.

Похожие термины

Ещё термины: Основы ИИ