Запись архива

ThunderPhone v2: новая архитектура для голосового ИИ без трёхшагового пайплайна

ThunderPhone запустил v2 с альтернативой классическому пайплайну «транскрипция → LLM → TTS», используя несколько моделей транскрипции и прямую подачу аудио в LLM. Цены — от 2 центов за минуту. Обсуждается на Hacker News.

Скриншот страницы ThunderPhone v2 с описанием архитектуры и цен
Скриншот страницы ThunderPhone v2 с описанием архитектуры и цен
Изображение из исходного материала

Что произошло

Разработчик Алекс из ThunderPhone анонсировал вторую версию платформы для голосового ИИ. Главное изменение — отказ от стандартного трёхшагового пайплайна (распознавание речи → LLM → синтез речи) в пользу гибридной архитектуры. ThunderPhone v2 одновременно запускает несколько моделей транскрипции, передаёт аудио напрямую в LLM и комбинирует быстрые и «думающие» модели для естественного диалога. Доступны три тарифа: Spark (2 цента/мин), Bolt (5 центов/мин) и Storm (9 центов/мин).

Почему это обсуждают

На Hacker News пост набрал активное обсуждение, поскольку затрагивает ключевую проблему современных голосовых агентов: качество и скорость. Классический трёхшаговый пайплайн, по мнению автора, страдает от трёх недостатков: ошибки одной модели транскрипции необратимы; быстрые LLM без «мышления» допускают глупые ошибки; естественное управление разговором (шум, перебивания, паузы) остаётся сложной задачей. ThunderPhone предлагает альтернативу, которая уже работает в продакшене, а не просто обещана.

Что подтверждено

Punkt Detail
Платформа ThunderPhone v2 запущена, доступна для звонков и API
Архитектура Мультитранскрипция + прямая подача аудио в LLM + комбинация быстрых и «думающих» моделей
Цены Spark — 2¢/мин, Bolt — 5¢/мин, Storm — 9¢/мин (+3¢ за доп. возможности)
Бенчмарк 99,4% на Big Bench Audio — утверждается как лучшее значение
Функции Поддержка тонального набора, детекция голосовой почты, cold outbound с TCPA-комплаенсом, BAA/DPA
Ограничения Не раскрыта детальная архитектура «думающей» модели; нет независимых тестов

Что остаётся неясным

Насколько архитектура ThunderPhone масштабируется для миллионов одновременных звонков — не раскрыто. Также не указано, какие именно модели используются для «мышления» (вероятно, проприетарная комбинация). Отсутствуют результаты A/B-тестов в реальных кейсах (поддержка, продажи) с независимой оценкой. Сравнение с GPT-Live от OpenAI — скорее контекст, чем прямая конкуренция: GPT-Live пока не интегрирован в телефонные звонки.

Что смотреть дальше

Стоит изучить API ThunderPhone, особенно параметры модели и настройки «думающего» режима. Полезна будет проверка бенчмарка Big Bench Audio — насколько он релевантен для конкретных сценариев (например, медицинские или юридические звонки). Также имеет смысл отследить, появится ли у OpenAI публичный API для голосовых звонков на базе GPT-Live.

Источники: оригинальный пост на Hacker News (https://news.ycombinator.com/item?id=thunderphone-v2), страница платформы (https://thunderphone.com), верификация — блог OpenAI (https://openai.com/news/).