core-ai
Словарь ↗Квантизация
Квантизация — это техника сжатия модели, снижающая числовую точность, используемую для хранения весов и/или активаций модели — например, преобразование весов из 16-битной плавающей точки (FP16) в 8-битные целые числа (INT8) или даже 4-битное представление (INT4) — что резко уменьшает объём памяти модели и ускоряет инференс ценой некоторой потери точности (обычно небольшой при аккуратном подходе). Это критически важно для практического развёртывания ИИ, потому что размер модели напрямую определяет, какое железо вам нужно и насколько быстро/дёшево работает инференс: модель на 70 миллиардов параметров при полной точности FP16 требует примерно 140 ГБ памяти GPU только для загрузки, что требует нескольких дорогих топовых GPU; та же модель, квантизованная до 4 бит, требует примерно 35 ГБ, помещаясь на одну потребительскую или проф-GPU при лишь умеренном компромиссе по качеству для большинства задач. Для SaaS-разработчиков квантизация — ключевой рычаг, делающий экономически жизнеспособным самостоятельное размещение моделей с открытыми весами (Llama, Mistral, Qwen), и она же используется поставщиками API внутренне для обслуживания моделей быстрее и дешевле в масштабе — когда поставщик предлагает «быстрый» или «мини» уровень, квантизация (наряду с действительно меньшими архитектурами моделей) часто является частью того, как они этого добиваются. Конкретный пример: стартап хочет самостоятельно разместить модель автодополнения кода по причинам локального размещения/суверенитета данных. Модель с полной точностью на 34 млрд параметров требует ~68 ГБ VRAM — слишком много для одной GPU A100 (80 ГБ, но впритык с учётом накладных расходов). Применив 4-битную квантизацию (используя технику вроде GPTQ или AWQ), та же модель сжимается примерно до 18 ГБ, комфортно помещаясь на одну потребительскую RTX 4090 (24 ГБ), и скорость инференса улучшается, потому что через память нужно перемещать меньше данных — часто именно это реальное узкое место в инференсе LLM, а не сырые вычисления. Квантизация не бесплатна: агрессивная квантизация (ниже 4 бит) может измеримо ухудшить качество вывода, особенно на задачах, требующих точного рассуждения, поэтому продакшн-развёртывания обычно сравнивают качество квантизованной модели с базовой линией полной точности перед запуском. Разные методы квантизации по-разному балансируют скорость, память и точность, и разработчикам, размещающим модели самостоятельно, стоит знать основные семейства: методы посттренировочной квантизации (post-training quantization, PTQ), такие как GPTQ и AWQ, квантизуют уже обученную модель без переобучения — быстро применять, но с несколько большей потерей точности при очень низкой битности; квантизационно-осознанное обучение (quantization-aware training, QAT) включает снижение точности прямо в процесс обучения, обычно сохраняя больше точности, но требуя доступа для переобучения модели, что невозможно с закрытыми моделями и дорого даже с открытыми весами. Для большинства SaaS-разработчиков, самостоятельно размещающих модель с открытыми весами, 8-битная или 4-битная PTQ-квантизация (через хорошо поддерживаемую библиотеку вроде llama.cpp, GGUF или bitsandbytes) — практичный выбор по умолчанию, который стоит сравнить с базовой линией полной точности на вашей реальной задаче перед принятием окончательного решения.
Похожие термины