COMRAD404 / GLOSSARY

Edge AI

Edge AI

Edge AI — это не один инструмент, а способ запускать и обслуживать ИИ-модели на устройстве или рядом с ним. Разбираем стек: runtime, ускорители, serving, Jetson, LiteRT, OpenVINO и KServe.

TL;DR

Edge AI — это запуск и обслуживание ИИ-моделей на устройстве или рядом с ним, включая runtime, ускорители, доставку модели и при необходимости локальный serving.

Edge AI (англ. Edge AI) — это запуск и обслуживание ИИ-моделей на устройстве или рядом с ним, а не только в удалённом облаке. В инфраструктурном смысле это стек для конвертации, оптимизации, запуска и доставки модели на edge-площадке: runtime/inference, доступ к CPU/GPU/NPU, упаковка и распространение, а иногда и локальный model serving с оркестрацией. По состоянию на 2026-08-18 в переданных источниках вокруг этого термина активны экосистемы LiteRT, OpenVINO, ONNX Runtime, NVIDIA JetPack / Jetson Linux и KServe.

Английский термин: Edge AI. Также встречается: on-device AI, edge inference, on-device inference. Важно: это не один продукт и не один runtime, а зонтичное название для нескольких слоёв edge-инфраструктуры.

Простыми словами

Грубо говоря, Edge AI — это когда ИИ работает ближе к месту, где возникает задача: в телефоне, на встраиваемом устройстве, на локальном мини-сервере или в маленьком кластере рядом с камерами, датчиками или пользователями. Вместо схемы «всё отправляем в удалённое облако» вы переносите часть вычислений к краю сети.

Можно представить это как кухню рядом с залом, а не одну центральную фабрику на другом конце города. Но это именно аналогия: на практике нужно не только «перенести модель ближе», а собрать рабочий стек — от формата модели и runtime до ускорителя, способа обновления и локального serving-слоя.

Как это работает

Edge AI обычно строится как последовательность слоёв. Один и тот же термин охватывает и запуск модели внутри приложения, и локальный сервер рядом с устройствами, и платформенный SDK для специализированного железа.

Модель
  ↓
Конвертация / оптимизация
  ↓
Runtime для инференса
  ↓
Доступ к CPU / GPU / NPU
  ↓
Упаковка и доставка
  ↓
Запуск на устройстве или рядом с ним
  ↓
Локальный model serving / orchestration (опционально)
  • Runtime на устройстве. LiteRT у Google описан как on-device framework для high-performance ML и GenAI на edge-платформах, а README прямо называет его successor to TensorFlow Lite. ONNX Runtime, по своей release-servicing документации, выпускается примерно ежеквартально, использует rel-ветки и декларирует backwards compatibility.
  • Доступ к ускорителям. Документация LiteRT по NPU говорит о unified NPU interface и поддержке двух путей компиляции: AOT и on-device compilation. Для Android NPU-сценариев указаны ограничения: API level 31+ и ABI arm64-v8a; Google Tensor SDK отмечен как beta и пока не поддерживает on-device (JIT) compilation.
  • Конвертация и оптимизация. OpenVINO в переданных материалах выступает как стек для inference, model conversion и optimization в Intel-ориентированных CPU/GPU/NPU сценариях. При этом install documentation отдельно уточняет, что OpenVINO 2026.3 не является LTS-релизом.
  • Платформенный слой устройства. Для Jetson-устройств JetPack bundles Jetson platform software. Jetson Linux 39.2 GA, согласно документации, поддерживает семейства Jetson Thor и Jetson Orin.
  • Локальный serving. OpenVINO Model Server можно разворачивать в Docker, на bare metal Linux или Windows, а также в Kubernetes. В release notes OVMS указано, что Python поддерживают только пакеты с суффиксом _python_on.
  • Оркестрация edge-кластера. KServe — это Kubernetes-native слой serving. Его release policy говорит о minor cadence примерно раз в 8 недель и поддержке двух последних minor-релизов.

Если вам важен именно текущий срез экосистемы, то на дату source pack официальные страницы показывают: LiteRT v2.2.0 как Latest (релиз опубликован 2026-08-13), ONNX Runtime v1.29.0 как Latest (2026-08-12), OpenVINO поддерживаемыми ветками 2026.3.0 development и 2025.4.1 maintenance, OVMS v2026.3 (2026-08-04), JetPack 7.2.1 с Jetson Linux 39.2.1 и KServe v0.19 как Active / latest (2026-06-12).

Практический смысл: Edge AI заканчивается не на словах «запустить модель локально». Обычно нужно ещё решить, как модель попадает на устройство, какой ускоритель доступен, как обновляется артефакт и нужен ли вам server-слой рядом с устройствами.

Где применяется

  1. Мобильные приложения с локальным инференсом. В экосистеме Google это сценарии on-device ML и GenAI через LiteRT. Если нужен NPU на Android, приходится учитывать требования API 31+, arm64-v8a и доставку через Google Play for On-device AI вместе с Play Feature Delivery.
  2. Intel-окружения. OpenVINO подходит там, где нужно конвертировать, оптимизировать и запускать модель локально на Intel CPU, GPU или NPU без обязательной привязки к облачному endpoint.
  3. Специализированные Jetson-устройства. Здесь Edge AI — это не только inference runtime, но и платформенный софт. Для таких сценариев используют JetPack и Jetson Linux как основу edge-устройства.
  4. Локальные или on-prem edge-кластеры. Когда модель не вшивается в приложение, а выдаётся как сервис рядом с устройствами, используют OpenVINO Model Server или KServe в Docker, на bare metal или в Kubernetes.

Практический пример

Сценарий: вы хотите запустить модель на Android-устройстве с NPU.

  1. Сначала определяете архитектуру: вам нужен именно on-device запуск, а не удалённый облачный вызов.
  2. Выбираете LiteRT как runtime. В официальном README он описан как on-device framework и successor to TensorFlow Lite.
  3. Планируете использование NPU. Документация LiteRT указывает unified NPU interface и два варианта компиляции: AOT и on-device compilation.
  4. Проверяете требования целевого устройства: Android API level 31+ и ABI arm64-v8a.
  5. Продумываете доставку модели и компонентов: для Android в документации упомянуты Google Play for On-device AI и Play Feature Delivery.
  6. Если вы ориентируетесь на Google Tensor SDK, заранее учитываете ограничение: он находится в beta и пока не поддерживает on-device (JIT) compilation.

Этот пример показывает, что Edge AI — это не просто «поместить модель в приложение». Вам нужно связать runtime, ускоритель, способ компиляции и канал распространения. Редакционное ограничение: я не привожу команды сборки, примеры CLI и benchmark-сравнения, потому что в переданном source pack нет проверенных пошаговых команд и сопоставимых независимых измерений.

Чем отличается от…

Термин Что означает Чего не означает
Edge AI Зонтичный термин для запуска ИИ на устройстве или рядом с ним: runtime, ускорители, упаковка, доставка, а иногда local serving и orchestration. Не указывает конкретный фреймворк, формат модели или семейство железа.
On-device AI Частный случай Edge AI, где инференс идёт прямо на конечном устройстве. Типичный пример из источников — LiteRT. Не покрывает локальный server-слой или кластер рядом с устройствами.
Model serving на edge Слой, который выдаёт модель как сервис рядом с устройствами. В переданных источниках это OVMS и KServe. Не заменяет runtime внутри приложения и не решает платформенные задачи устройства.
Платформенный SDK / BSP Программная база для конкретного семейства устройств. В source pack таким примером выступает JetPack, который bundles Jetson platform software. Не является универсальным runtime для любых edge-платформ.

Ограничения и заблуждения

  • Заблуждение: Edge AI = только смартфон без облака. В переданном source pack термин трактуется шире: это и on-device, и near-device сценарии, включая локальный serving и orchestration.
  • Заблуждение: любой runtime автоматически даст доступ к NPU. На практике доступ к ускорителю зависит от вендора и устройства. У LiteRT для Android NPU-сценарии завязаны на API 31+, arm64-v8a и конкретный путь распространения.
  • Ограничение по веткам релизов. Вендорские экосистемы быстро меняются и часто делятся на development и maintenance. Например, OpenVINO 2026.3 прямо отмечен как не-LTS, а поддерживаемыми версиями названы 2026.3.0 и 2025.4.1.
  • Ограничение по производительности. Release notes OpenVINO 2026.2 отдельно предупреждают о performance regression для многих computer-vision моделей по сравнению с OpenVINO 2026.0. Для edge-стека это важное напоминание: проверять нужно свою версию и свою модель.
  • Ограничение по serving-слою. В OVMS поддержка Python есть только у пакетов с суффиксом _python_on.
  • Ограничение по оркестрации. KServe остаётся pre-1.0 проектом; по release policy minor-версии выходят примерно раз в 8 недель, а поддерживаются лишь две последние ветки.
  • Ограничение по стоимости и доступности. В официальных страницах из source pack нет единой цены на Edge AI как класс. Во многих случаях это open-source software поверх платного железа, поддержки или облачной инфраструктуры; региональная доступность также может зависеть от устройства и канала дистрибуции.

Практический вердикт. Не выбирайте «Edge AI» как единый продукт. Сначала ответьте на три вопроса: модель должна жить внутри приложения, на локальном сервере рядом с устройствами или на специализированном железе с собственным SDK? От этого зависит, смотреть ли вам прежде всего на LiteRT и ONNX Runtime, на OpenVINO и OVMS или на JetPack и KServe.

Связанные термины и инструменты

Если вы строите локальные сценарии автоматизации, полезно отдельно понять, что такое AI Agent (ИИ-агент) и как в таких системах трактуется AI Safety (безопасность ИИ). Для no-code сценариев orchestration и RAG рядом с пользователем посмотрите Voiceflow — no-code платформу для AI-агентов и RAG. Если же вам нужен более широкий ландшафт самохостящихся решений, пригодится подборка 7 лучших open-source AI-инструментов.

Источники

Вопросы и ответы

Edge AI и on-device AI — это одно и то же?

Нет. On-device AI — это частный случай, когда модель исполняется прямо на конечном устройстве. Edge AI шире: в переданном source pack сюда входят и near-device сценарии, например локальный model serving или orchestration рядом с устройствами.

Какой стек чаще используют для Android-устройств?

По текущим источникам Google продвигает LiteRT как on-device framework и successor to TensorFlow Lite. Для NPU-сценариев нужно учитывать ограничения: API 31+, arm64-v8a и поддержку конкретного устройства или вендора.

OpenVINO — это только runtime?

Нет. В переданных источниках OpenVINO описывается как стек для model conversion, optimization и local inference, а рядом с ним есть OpenVINO Model Server для serving-сценариев.

Нужен ли KServe в каждом Edge AI-проекте?

Нет. В source pack orchestration названа опциональной частью edge-стека. KServe нужен тогда, когда у вас есть Kubernetes-native serving на локальном или edge-кластере, а не просто модель внутри приложения или одного устройства.

Источники

SOURCES

Вопросы и ответы

FAQ
Edge AI и on-device AI — это одно и то же?

Нет. On-device AI — это частный случай, когда модель исполняется прямо на конечном устройстве. Edge AI шире и включает также near-device сценарии: локальный model serving и orchestration рядом с устройствами.

Какой стек чаще используют для Android-устройств?

По текущим источникам Google продвигает LiteRT как on-device framework и successor to TensorFlow Lite. Для NPU-сценариев нужно учитывать ограничения: API 31+, arm64-v8a и поддержку конкретного устройства или вендора.

OpenVINO — это только runtime?

Нет. В переданных источниках OpenVINO выступает как стек для model conversion, optimization и local inference, а рядом с ним есть OpenVINO Model Server для serving-сценариев.

Нужен ли KServe в каждом Edge AI-проекте?

Нет. Orchestration — опциональная часть edge-стека. KServe нужен, когда у вас есть Kubernetes-native serving на локальном или edge-кластере, а не просто модель внутри приложения или одного устройства.

Читайте также

LINKS