core-ai
Словарь ↗Малая языковая модель (SLM)
Малая языковая модель (Small Language Model, SLM) — это языковая модель, намеренно построенная и обученная в гораздо меньшем масштабе параметров, чем передовые LLM — обычно от нескольких сотен миллионов до нескольких миллиардов параметров против десятков или сотен миллиардов (или больше) у передовых моделей — оптимизированная для эффективной работы на ограниченном оборудовании, включая потребительские ноутбуки, телефоны и даже встраиваемые устройства, а не требующая GPU дата-центра. SLM жертвуют частью общих возможностей и широты знаний ради резкого выигрыша в скорости, стоимости, приватности и простоте развёртывания: хорошо обученная SLM может выполнять инференс с почти мгновенной задержкой прямо на устройстве, с нулевой платой за токен через API и без того, чтобы какие-либо данные покидали устройство, — ценой меньшей эффективности в сложных, открытых задачах рассуждения по сравнению с передовой моделью. Это важно для разработчиков SaaS и приложений в конкретных, ценных сценариях использования, где такой компромисс оправдан: функции на устройстве, которые должны работать офлайн или с строгими гарантиями приватности (локальный поиск/суммаризация в приложении для заметок, предсказание следующего слова в клавиатуре, голосовой ассистент на устройстве), узкие, чётко определённые задачи, где дообученная малая модель может сравняться по точности с гораздо более крупной общей моделью (классификация, простое извлечение данных, генерация в определённом формате), и чувствительные к стоимости высоконагруженные приложения, где маршрутизация простых запросов на SLM с эскалацией только сложных на передовую модель резко снижает общие расходы на API. Конкретный пример: мобильное приложение для заметок хочет предложить функции «суммировать эту заметку» и «извлечь пункты действий», которые работают мгновенно, офлайн и без отправки чьих-либо личных заметок в облачный API. Разработчики встраивают небольшую (примерно 1-3 миллиарда параметров), квантованную модель с открытыми весами прямо в приложение, выполняя инференс полностью на устройстве пользователя — функция отвечает менее чем за секунду с нулевым сетевым обращением и без утечки данных с телефона, принимая, что резюме получаются несколько менее отточенными, чем то, что произвела бы облачная передовая модель, потому что для этой конкретной задачи и требования приватности такой компромисс явно в пользу малой модели на устройстве. Модели Apple на устройстве, семейство Phi от Microsoft и семейство Gemma от Google — яркие примеры SLM, спроектированных именно для этого эффективного, повсеместно развёртываемого сценария использования. SLM также всё чаще используются как «быстрый первый проход» в двухуровневой архитектуре, а не исключительно как самостоятельное решение: лёгкая SLM напрямую обрабатывает простые, высоко достоверные случаи (или выполняет первичную классификацию/сортировку), эскалируя только действительно неоднозначные или сложные случаи к более крупной передовой модели — этот паттерн улавливает большую часть выигрыша малой модели по стоимости и задержке, сохраняя качество передового уровня на той более сложной подгруппе запросов, которая в этом реально нуждается, вместо того чтобы навязывать выбор «всё или ничего» между уровнями моделей для всей функции целиком.
Похожие термины