core-ai
Словарь ↗Внимание со скользящим окном
Внимание со скользящим окном ограничивает каждый токен фиксированной по размеру окрестностью недавних токенов вместо всей последовательности. Обычное внимание сравнивает каждый токен с каждым, поэтому стоимость и память растут как квадрат длины последовательности — отсюда и дороговизна обслуживания длинных контекстов. Окно, скажем, в несколько тысяч токенов превращает этот рост в линейный, потому что работа на токен перестаёт зависеть от длины документа. Информация всё же распространяется дальше одного окна: раз каждый слой смотрит внутри своего окна, токен может испытать влияние материала, отстоящего на несколько окон, — так же, как стопка небольших свёрток покрывает широкое рецептивное поле. Поэтому многие модели с длинным контекстом чередуют оконные слои с несколькими слоями полного внимания: большая часть последовательности обрабатывается дёшево, а часть слоёв сохраняет глобальный обзор. Компромисс стоит назвать прямо. Оконность снижает стоимость длинных входов, но ослабляет точное припоминание детали, лежащей далеко за пределами текущего окна, — именно этот эффект делает модель ненадёжной в задачах вида «найди в этом договоре один пункт». Если ваша нагрузка зависит от прицельного извлечения из большого документа, шаг поиска, который кладёт нужный фрагмент рядом с вопросом, надёжнее любой надежды на то, что механизм внимания дотянется через весь вход.
Похожие термины