Токен

Токен — это наименьшая единица текста, на которые токенизатор LLM разбивает вход и выход для обработки — это не совсем символ и не совсем слово, а статистически выбранный фрагмент, который может быть целым распространённым словом («the»), частью более длинного слова («token» → «tok» + «en») или одним знаком препинания. В английском языке полезное эмпирическое правило: 100 токенов ≈ 75 слов, хотя это варьируется в зависимости от языка (нерусские, а точнее не-английские языки, особенно использующие не-латинские алфавиты, часто токенизируются гораздо менее эффективно, то есть то же самое предложение обходится в большее число токенов; это касается и русского языка с кириллицей). Токены критически важны для SaaS-разработчиков, потому что это буквальная единица всего, что стоит денег и времени в приложениях с LLM: цена API указывается за миллион входных/выходных токенов (например, Claude Sonnet 4.5 — примерно 3$/15$ за миллион входных/выходных токенов), контекстное окно измеряется в токенах (а не словах или символах), а задержка генерации масштабируется с количеством выходных токенов, поскольку модели генерируют по одному токену за раз. Конкретный пример: предложение «Пожалуйста, суммируй этот документ в трёх пунктах» токенизируется примерно в 11 токенов. Если разработчик отправляет документ на 10 000 слов (~13 000 токенов) плюс инструкцию на 50 токенов и получает обратно резюме на 100 токенов, вызов API стоит примерно 13 050 входных токенов и 100 выходных токенов — а поскольку выходные токены обычно оцениваются в 4-5 раз дороже входных, многословные ответы непропорционально дороги. Именно поэтому экономные разработчики инструктируют модели быть краткими, кэшируют повторяющийся контекст (prompt caching) и выбирают меньшие/дешёвые модели для задач с высоким объёмом и низкой сложностью. Понимание токенизации также объясняет странное поведение LLM, например, историческую проблему моделей с подсчётом букв в слове («сколько букв р в слове клубника») — потому что модель видит токены, а не отдельные символы. Разработчикам также стоит знать, что токены расходуются с обеих сторон запроса — каждый токен в вашем промпте (системные инструкции, история диалога, извлечённый RAG-контекст) считается входным токеном, а каждый токен, сгенерированный моделью, считается выходным токеном, причём большинство поставщиков оценивают выходные токены в несколько раз дороже входных, потому что генерация вычислительно дороже на токен, чем чтение. Эта асимметрия — причина, по которой инструкция модели «быть краткой» или ограничение `max_tokens` в вызове API — это настоящий рычаг контроля затрат, а не просто предпочтение по UX, и почему функция чата, позволяющая истории диалога расти неограниченно (пересылая всю историю как входные токены на каждом ходу), может незаметно стать одной из самых дорогих частей структуры затрат ИИ в SaaS-продукте по мере удлинения разговоров.

Похожие термины

Ещё термины: Основы ИИ