Edge AI (англ. Edge AI) — это запуск и обслуживание ИИ-моделей на устройстве или рядом с ним, а не только в удалённом облаке. В инфраструктурном смысле это стек для конвертации, оптимизации, запуска и доставки модели на edge-площадке: runtime/inference, доступ к CPU/GPU/NPU, упаковка и распространение, а иногда и локальный model serving с оркестрацией. По состоянию на 2026-08-18 в переданных источниках вокруг этого термина активны экосистемы LiteRT, OpenVINO, ONNX Runtime, NVIDIA JetPack / Jetson Linux и KServe.
Английский термин: Edge AI. Также встречается: on-device AI, edge inference, on-device inference. Важно: это не один продукт и не один runtime, а зонтичное название для нескольких слоёв edge-инфраструктуры.
Простыми словами
Грубо говоря, Edge AI — это когда ИИ работает ближе к месту, где возникает задача: в телефоне, на встраиваемом устройстве, на локальном мини-сервере или в маленьком кластере рядом с камерами, датчиками или пользователями. Вместо схемы «всё отправляем в удалённое облако» вы переносите часть вычислений к краю сети.
Можно представить это как кухню рядом с залом, а не одну центральную фабрику на другом конце города. Но это именно аналогия: на практике нужно не только «перенести модель ближе», а собрать рабочий стек — от формата модели и runtime до ускорителя, способа обновления и локального serving-слоя.
Как это работает
Edge AI обычно строится как последовательность слоёв. Один и тот же термин охватывает и запуск модели внутри приложения, и локальный сервер рядом с устройствами, и платформенный SDK для специализированного железа.
Модель ↓ Конвертация / оптимизация ↓ Runtime для инференса ↓ Доступ к CPU / GPU / NPU ↓ Упаковка и доставка ↓ Запуск на устройстве или рядом с ним ↓ Локальный model serving / orchestration (опционально)
- Runtime на устройстве. LiteRT у Google описан как on-device framework для high-performance ML и GenAI на edge-платформах, а README прямо называет его successor to TensorFlow Lite. ONNX Runtime, по своей release-servicing документации, выпускается примерно ежеквартально, использует rel-ветки и декларирует backwards compatibility.
- Доступ к ускорителям. Документация LiteRT по NPU говорит о unified NPU interface и поддержке двух путей компиляции: AOT и on-device compilation. Для Android NPU-сценариев указаны ограничения: API level 31+ и ABI arm64-v8a; Google Tensor SDK отмечен как beta и пока не поддерживает on-device (JIT) compilation.
- Конвертация и оптимизация. OpenVINO в переданных материалах выступает как стек для inference, model conversion и optimization в Intel-ориентированных CPU/GPU/NPU сценариях. При этом install documentation отдельно уточняет, что OpenVINO 2026.3 не является LTS-релизом.
- Платформенный слой устройства. Для Jetson-устройств JetPack bundles Jetson platform software. Jetson Linux 39.2 GA, согласно документации, поддерживает семейства Jetson Thor и Jetson Orin.
- Локальный serving. OpenVINO Model Server можно разворачивать в Docker, на bare metal Linux или Windows, а также в Kubernetes. В release notes OVMS указано, что Python поддерживают только пакеты с суффиксом
_python_on. - Оркестрация edge-кластера. KServe — это Kubernetes-native слой serving. Его release policy говорит о minor cadence примерно раз в 8 недель и поддержке двух последних minor-релизов.
Если вам важен именно текущий срез экосистемы, то на дату source pack официальные страницы показывают: LiteRT v2.2.0 как Latest (релиз опубликован 2026-08-13), ONNX Runtime v1.29.0 как Latest (2026-08-12), OpenVINO поддерживаемыми ветками 2026.3.0 development и 2025.4.1 maintenance, OVMS v2026.3 (2026-08-04), JetPack 7.2.1 с Jetson Linux 39.2.1 и KServe v0.19 как Active / latest (2026-06-12).
Практический смысл: Edge AI заканчивается не на словах «запустить модель локально». Обычно нужно ещё решить, как модель попадает на устройство, какой ускоритель доступен, как обновляется артефакт и нужен ли вам server-слой рядом с устройствами.
Где применяется
- Мобильные приложения с локальным инференсом. В экосистеме Google это сценарии on-device ML и GenAI через LiteRT. Если нужен NPU на Android, приходится учитывать требования API 31+, arm64-v8a и доставку через Google Play for On-device AI вместе с Play Feature Delivery.
- Intel-окружения. OpenVINO подходит там, где нужно конвертировать, оптимизировать и запускать модель локально на Intel CPU, GPU или NPU без обязательной привязки к облачному endpoint.
- Специализированные Jetson-устройства. Здесь Edge AI — это не только inference runtime, но и платформенный софт. Для таких сценариев используют JetPack и Jetson Linux как основу edge-устройства.
- Локальные или on-prem edge-кластеры. Когда модель не вшивается в приложение, а выдаётся как сервис рядом с устройствами, используют OpenVINO Model Server или KServe в Docker, на bare metal или в Kubernetes.
Практический пример
Сценарий: вы хотите запустить модель на Android-устройстве с NPU.
- Сначала определяете архитектуру: вам нужен именно on-device запуск, а не удалённый облачный вызов.
- Выбираете LiteRT как runtime. В официальном README он описан как on-device framework и successor to TensorFlow Lite.
- Планируете использование NPU. Документация LiteRT указывает unified NPU interface и два варианта компиляции: AOT и on-device compilation.
- Проверяете требования целевого устройства: Android API level 31+ и ABI arm64-v8a.
- Продумываете доставку модели и компонентов: для Android в документации упомянуты Google Play for On-device AI и Play Feature Delivery.
- Если вы ориентируетесь на Google Tensor SDK, заранее учитываете ограничение: он находится в beta и пока не поддерживает on-device (JIT) compilation.
Этот пример показывает, что Edge AI — это не просто «поместить модель в приложение». Вам нужно связать runtime, ускоритель, способ компиляции и канал распространения. Редакционное ограничение: я не привожу команды сборки, примеры CLI и benchmark-сравнения, потому что в переданном source pack нет проверенных пошаговых команд и сопоставимых независимых измерений.
Чем отличается от…
| Термин | Что означает | Чего не означает |
|---|---|---|
| Edge AI | Зонтичный термин для запуска ИИ на устройстве или рядом с ним: runtime, ускорители, упаковка, доставка, а иногда local serving и orchestration. | Не указывает конкретный фреймворк, формат модели или семейство железа. |
| On-device AI | Частный случай Edge AI, где инференс идёт прямо на конечном устройстве. Типичный пример из источников — LiteRT. | Не покрывает локальный server-слой или кластер рядом с устройствами. |
| Model serving на edge | Слой, который выдаёт модель как сервис рядом с устройствами. В переданных источниках это OVMS и KServe. | Не заменяет runtime внутри приложения и не решает платформенные задачи устройства. |
| Платформенный SDK / BSP | Программная база для конкретного семейства устройств. В source pack таким примером выступает JetPack, который bundles Jetson platform software. | Не является универсальным runtime для любых edge-платформ. |
Ограничения и заблуждения
- Заблуждение: Edge AI = только смартфон без облака. В переданном source pack термин трактуется шире: это и on-device, и near-device сценарии, включая локальный serving и orchestration.
- Заблуждение: любой runtime автоматически даст доступ к NPU. На практике доступ к ускорителю зависит от вендора и устройства. У LiteRT для Android NPU-сценарии завязаны на API 31+, arm64-v8a и конкретный путь распространения.
- Ограничение по веткам релизов. Вендорские экосистемы быстро меняются и часто делятся на development и maintenance. Например, OpenVINO 2026.3 прямо отмечен как не-LTS, а поддерживаемыми версиями названы 2026.3.0 и 2025.4.1.
- Ограничение по производительности. Release notes OpenVINO 2026.2 отдельно предупреждают о performance regression для многих computer-vision моделей по сравнению с OpenVINO 2026.0. Для edge-стека это важное напоминание: проверять нужно свою версию и свою модель.
- Ограничение по serving-слою. В OVMS поддержка Python есть только у пакетов с суффиксом
_python_on. - Ограничение по оркестрации. KServe остаётся pre-1.0 проектом; по release policy minor-версии выходят примерно раз в 8 недель, а поддерживаются лишь две последние ветки.
- Ограничение по стоимости и доступности. В официальных страницах из source pack нет единой цены на Edge AI как класс. Во многих случаях это open-source software поверх платного железа, поддержки или облачной инфраструктуры; региональная доступность также может зависеть от устройства и канала дистрибуции.
Практический вердикт. Не выбирайте «Edge AI» как единый продукт. Сначала ответьте на три вопроса: модель должна жить внутри приложения, на локальном сервере рядом с устройствами или на специализированном железе с собственным SDK? От этого зависит, смотреть ли вам прежде всего на LiteRT и ONNX Runtime, на OpenVINO и OVMS или на JetPack и KServe.
Связанные термины и инструменты
Если вы строите локальные сценарии автоматизации, полезно отдельно понять, что такое AI Agent (ИИ-агент) и как в таких системах трактуется AI Safety (безопасность ИИ). Для no-code сценариев orchestration и RAG рядом с пользователем посмотрите Voiceflow — no-code платформу для AI-агентов и RAG. Если же вам нужен более широкий ландшафт самохостящихся решений, пригодится подборка 7 лучших open-source AI-инструментов.
Источники
- GitHub – google-ai-edge/LiteRT
- Releases · google-ai-edge/LiteRT
- NPU acceleration with LiteRT | Google for Developers
- Install OpenVINO™ 2026.3 — OpenVINO™ documentation
- OpenVINO Release Notes — OpenVINO™ documentation
- Deploy Model Server — OpenVINO™ documentation
- Releases · openvinotoolkit/model_server
- Releases | onnxruntime
- Releases · microsoft/onnxruntime
- NVIDIA JetPack SDK Downloads and Notes
- Welcome — NVIDIA Jetson Linux Developer Guide
- kserve/RELEASES.md at master · kserve/kserve
Вопросы и ответы
Edge AI и on-device AI — это одно и то же?
Нет. On-device AI — это частный случай, когда модель исполняется прямо на конечном устройстве. Edge AI шире: в переданном source pack сюда входят и near-device сценарии, например локальный model serving или orchestration рядом с устройствами.
Какой стек чаще используют для Android-устройств?
По текущим источникам Google продвигает LiteRT как on-device framework и successor to TensorFlow Lite. Для NPU-сценариев нужно учитывать ограничения: API 31+, arm64-v8a и поддержку конкретного устройства или вендора.
OpenVINO — это только runtime?
Нет. В переданных источниках OpenVINO описывается как стек для model conversion, optimization и local inference, а рядом с ним есть OpenVINO Model Server для serving-сценариев.
Нужен ли KServe в каждом Edge AI-проекте?
Нет. В source pack orchestration названа опциональной частью edge-стека. KServe нужен тогда, когда у вас есть Kubernetes-native serving на локальном или edge-кластере, а не просто модель внутри приложения или одного устройства.