Edge AI (ИИ на устройстве)

Edge AI выполняет инференс модели на устройстве, порождающем данные, или рядом с ним — телефоны, браузеры, IoT-датчики, заводские шлюзы — вместо похода в облачный API. Выигрыши: задержка (без сетевого прыжка реальны ответы быстрее 50 мс), приватность (сырые данные не покидают устройство), устойчивость офлайн и нулевые счета за инференс по запросам. Ограничение — возможности: на edge-железо помещаются квантизованные малые языковые модели, дистиллированные модели зрения и речи, но не фронтирные LLM, поэтому точность отстаёт от облака. Мейнстрим-примеры — on-device-уровень Apple Intelligence, Gemini Nano на Android и инференс в браузере через WebGPU и ONNX Runtime. Доминирующий продакшн-паттерн — гибрид: частые, чувствительные к задержке или приватные запросы обрабатываются локально, а сложные эскалируются в облачную модель. Для SaaS-команд edge AI — это ещё и история о цене: стоимость инференса переносится с вашей маржи на железо, которым клиент уже владеет.

Похожие термины

Ещё термины: Облако и инфраструктура