Большая языковая модель (LLM)

Большая языковая модель (LLM) — это нейросеть, почти всегда построенная на архитектуре трансформера, обученная на огромных объёмах текста (а всё чаще и кода, изображений, аудио) предсказывать следующий токен в последовательности. Эта простая цель обучения, применённая в масштабе сотен миллиардов или триллионов параметров и триллионов обучающих токенов, порождает модели, способные писать, суммировать, переводить, рассуждать пошагово и вести диалог. Claude, GPT-4/GPT-5, Gemini и Llama — всё это LLM, хотя они различаются деталями архитектуры, обучающими данными и тем, как их выравнивают (align), чтобы они были полезными и безопасными. Для SaaS-разработчиков LLM — это движок рассуждений почти за каждой «AI-фичей», которую сегодня выпускают: чат-боты поддержки, копилоты внутри существующих инструментов, генераторы контента и автономные агенты. На практике важно понимать: LLM — это вероятностный предсказатель следующего токена, а не база данных: она не «ищет» факты, а генерирует статистически наиболее вероятное продолжение вашего промпта, исходя из всего, что усвоила во время обучения. Именно поэтому LLM галлюцинируют, поэтому важно заземлять их с помощью ретривала (RAG) и поэтому дизайн промпта так сильно влияет на качество вывода. Под капотом запрос к API LLM — это список сообщений (системный промпт, реплики пользователя, реплики ассистента) плюс параметры вроде temperature и max tokens; модель возвращает completion, потокoво передаваемый токен за токеном. Конкретный пример: функция триажа тикетов поддержки может отправить `{"model": "claude-sonnet-4.5", "system": "Классифицируй тикеты как billing, bug, feature-request или other. Ответь только категорией.", "messages": [{"role": "user", "content": "С моей карты дважды списали за один и тот же счёт."}]}` и получить в ответ `"billing"` менее чем за секунду. Выбирая LLM, разработчики взвешивают стоимость за токен, задержку, размер контекстного окна и то, позволяет ли поставщик дообучение (fine-tuning) или требует кастомизации только через промпт. Модели с открытыми весами (Llama, Mistral) можно размещать на своих серверах для контроля над данными; закрытые модели (Claude, GPT) доступны через API и обновляются поставщиком. Выбор LLM для SaaS-фичи редко бывает разовым решением — большинство продакшн-команд направляют разные задачи на разные уровни моделей внутри одного семейства (быстрая, дешёвая модель для простой классификации; топовая модель для сложных рассуждений) и переоценивают выбор по мере выхода новых версий, поскольку модель, бывшая передовой полгода назад, сегодня может уступать более новому релизу и по стоимости, и по качеству. Разработчикам также стоит закладывать в бюджет то, что вывод LLM по умолчанию недетерминирован (даже при низкой temperature точная побайтовая воспроизводимость между вызовами не гарантирована) и версионирован (устаревание старого снапшота модели у поставщика может незаметно изменить поведение вашего продукта) — поэтому фиксация версий модели и мониторинг качества вывода со временем является стандартной продакшн-практикой, а не паранойей.

Похожие термины

Ещё термины: Основы ИИ