
NVIDIA выпустила TensorRT Model Connect (TRTMC) в режиме публичного предварительного просмотра. Это open-source проект, который позволяет за две команды преобразовать поддерживаемую модель из Hugging Face (или локальный чекпоинт) в готовый к запуску нативный C++ инференс. Ключевая особенность — отсутствие промежуточного этапа экспорта в ONNX, что устраняет один из наиболее частых источников ошибок при развертывании моделей.
Проект распространяется под лицензией Apache-2.0 и представляет собой набор референсных реализаций, сгруппированных по семействам моделей, а не единый универсальный конвертер. Это позволяет точнее настраивать оптимизацию под конкретную архитектуру.
Как это работает: две команды от чекпоинта до инференса
TRTMC разделяет процесс сборки и выполнения на два четких этапа. Первый этап — сборка. Команда `trtmc build` принимает идентификатор модели из Hugging Face, параметры точности и длину контекста, и на выходе создает версионированный артефакт `.bundle`. Пример для Qwen3-0.6B:
trtmc build Qwen/Qwen3-0.6B –precision bf16 –max-cache-length 16384 –output qwen3-0.6b.bundle
Второй этап — запуск. Команда `trtmc run` выполняет инференс на созданном бандле, используя нативный C++ код без участия PyTorch в рантайме. Тот же `.bundle` файл может быть загружен непосредственно из C++ приложения с помощью вызова `trtmc::load(“./qwen3-0.6b.bundle”)`.
Такой подход позволяет разработчикам встраивать инференс в C++ сервисы, встраиваемые приложения или робототехнические стеки, не требуя наличия полного стека Python и PyTorch в production-среде.
Под капотом: архитектура и требования
Архитектура TRTMC построена вокруг разделения ответственности. Python отвечает за разрешение чекпоинта и сборку движка TensorRT, в то время как нативные профили выполняют инференс на C++. Небольшое количество гибридных профилей могут вызывать вспомогательный Python-исполнитель, но такие зависимости явно декларируются в манифесте бандла.
Приложения взаимодействуют с моделями через единые task API: `generate()`, `transcribe()`, `generate_image()`, `embed()`, `solve()`. Это избавляет разработчиков от необходимости поддерживать этапы конвертации и писать специфическую для каждой модели интеграцию.
Команда `trtmc inspect` позволяет проверить содержимое бандла: его тип, семейство модели, точность, идентификатор рантайма и список движков. Это делает артефакт проверяемым и аудируемым.
Текущие ограничения: сборка под x86_64 требует Docker
На данный момент release-колеса (wheels) доступны только для Linux aarch64 (ARM64) с Python 3.10 или 3.12, glibc 2.39 или новее, и TensorRT 11.1.0.106. Для пользователей x86_64 колеса не опубликованы, и сборка из исходного кода выполняется через Docker. Это важное ограничение для значительной части разработчиков, работающих на стандартных x86-серверах.
NVIDIA также сообщает, что весь проект — реализации моделей, настройка производительности, тесты, интеграции и документация — был создан с использованием агентов OpenAI Codex под человеческим руководством и рецензированием.
Ключевые факты
| Параметр | Значение |
|---|---|
| Лицензия | Apache-2.0 |
| Поддерживаемые архитектуры | Linux aarch64 (нативные колеса), x86_64 (через Docker) |
| Зависимости | Python 3.10/3.12, glibc ≥ 2.39, TensorRT 11.1.0.106 |
| Формат артефакта | .bundle (версионированный) |
| API для инференса | generate(), transcribe(), generate_image(), embed(), solve() |
Что это значит для разработчиков
TRTMC решает несколько хронических проблем при развертывании моделей: экспортные разрывы при конвертации, необходимость повторной интеграции для каждой модели и рассредоточение валидации по нескольким конвертационным артефактам. Для команд, которые используют C++ в production (например, в высоконагруженных сервисах, edge-устройствах или робототехнике), это может существенно сократить время от экспериментов до внедрения.
Тем не менее, проект находится в стадии публичного предварительного просмотра, и его поддержка ограничена 105 профилями релиза, охватывающими 76 семейств моделей (согласно снэпшоту GB300 от 29 июля 2026 года). Разработчикам стоит учитывать это при планировании миграции.
Источник: MarkTechPost — NVIDIA Releases TensorRT Model Connect in Public Preview: Hugging Face Checkpoint to Native C++ Inference in Two Commands
