
Компания NVIDIA выпустила NemotronLabs VoiceChat 11B — открытую end-to-end модель для полнодуплексного речевого взаимодействия в реальном времени. Релиз нацелен на разработчиков голосовых ассистентов нового поколения, которым требуется низкая задержка и способность модели обрабатывать аудиопоток в оба направления одновременно.
Архитектурные особенности и задержка отклика
В отличие от традиционных каскадных схем, где последовательно задействуются распознавание речи ASR, текстовая языковая модель LLM и синтез TTS, новая разработка объединяет потоковое понимание и генерацию речи в единой нейросети. Это исключает лишние этапы оркестрации и снижает общие задержки при обмене репликами.
Гибридная архитектура модели опирается на компоненты Mamba и Transformer, объединяя наработки проектов SALM-Duplex и Audio Flamingo 3. На бенчмарке Full-Duplex-Bench 1.0 задержка смены реплик smooth turn-taking составила 448 мс. Модель способна удерживать контекст и слушать пользователя в момент собственного выступления, что позволяет перебивать агента на лету.
Ключевые факты
| Параметр | Значение |
|---|---|
| Архитектура | Гибридная Mamba/Transformer, 11B параметров |
| Задержка отклика | 448 мс (Full-Duplex-Bench 1.0) |
| Обучающие данные | Около 550 тысяч часов реального и синтетического аудио |
| Лицензия и статус | Открытые веса и контейнер, только для исследовательских целей |
Работа с внешними инструментами на лету
Одной из главных инженерных особенностей VoiceChat 11B стал механизм живого вызова функций tool calling прямо во время непрерывного диалога. Модель использует отдельный параллельный канал для генерации скриптов с тегом toolcall, в то время как основная беседа не прерывается.
Для компенсации пауз во время работы внешних API разработчики предусмотрели операторские сообщения on-hold. Система проговаривает заранее заданную короткую фразу, пока выполняются запросы. Однако интеграция накладывает строгие ограничения: рекомендуется использовать не более пяти инструментов за сессию, одновременный вызов нескольких функций работает нестабильно, а прерывать агента во время выполнения API-запроса нельзя.
Ограничения и текущий статус для разработчиков
Несмотря на открытую публикацию весов, исходного кода в репозитории NeMo Speech и готовых контейнеров на NGC, команда NVIDIA подчеркивает исследовательский статус релиза. Чекпоинт пока не рекомендуется использовать в жестких продакшн-окружениях из-за зафиксированных архитектурных сбоев.
Среди документированных проблем выделяются ограничение контекста аудио в две минуты, склонность модели скатываться в несвязанный бред после нескольких десятков итераций диалога, а также возможный бесконечный самоповтор после завершения реплики. Системные промпты и ответы инструментов должны быть строго ASCII-совместимыми для корректного синтеза речи.
Практическое значение для разработчиков ИИ-ассистентов
Для инженеров, занимающихся голосовыми интерфейсами и агентными системами, VoiceChat 11B служит важным полигоном для изучения задержек и дуплексного управления диалогом без сложных каскадных пайплайнов. Релиз показывает, как открытые речевые модели подступают к стандартам мгновенного отклика коммерческих API, хотя стабильность работы в реальных сценариях пока требует доработки. Перед запуском пилотных проектов стоит тщательно протестировать поведение модели на длинных сессиях и настроить обработку ошибок контекста.
Источник: MarkTechPost, https://www.marktechpost.com/2026/08/09/nvidia-releases-nemotronlabs-voicechat-11b-an-open-full-duplex-speech-to-speech-model-with-450-ms-turn-taking-and-live-tool-calling/