
Компания ElevenLabs официально представила новую модель синтеза речи Eleven v4 и её ускоренную версию Eleven v4 Turbo. Релиз состоялся 29 сентября 2026 года. По заявлению компании, v4 использует новую архитектуру, которая анализирует тон, темп и контекст сценария, а не просто озвучивает текст. Это позволяет модели точнее следовать режиссёрским указаниям — смех, шёпот, звуковые эффекты вроде хлопка двери — и сохранять консистентность голоса на протяжении длинных аудиопроектов, таких как аудиокниги.
Что изменилось в Eleven v4
Ключевое нововведение — новая архитектура анализа контекста. ElevenLabs утверждает, что модель теперь интерпретирует не отдельные строки, а всю сцену в диалогах: голоса персонажей реагируют на общий контекст разговора. Пользователи могут задавать интонации как через теги ([laughs], [whispering]), так и обычными предложениями на естественном языке, а также использовать фонетическое написание для контроля произношения имён и технических терминов. В компании отмечают, что управление произношением стало работать надёжнее, чем в v3.
Важное улучшение — консистентность голоса. ElevenLabs заявляет, что при регенерации отдельных фраз персонаж или рассказчик сохраняет одинаковое звучание на протяжении всего проекта. Один запрос может обрабатывать до 10 000 символов (примерно 10 минут аудио). Для более длинных работ, таких как аудиокниги, используется разбивка на сегменты, и компания обещает, что темп и подача остаются стабильными при переходах между ними.
Мультиязычность расширена с примерно 70 языков в v3 до более чем 90. Клонированные голоса, по заявлению ElevenLabs, могут говорить на других языках с естественным акцентом носителя, не «дрейфуя» обратно к исходному акценту со временем. Профессиональные голосовые клоны, которые не поддерживались в v3, снова доступны. «Мгновенный клон голоса» (Instant Voice Clone) теперь требует всего 10 секунд аудио.
Eleven v4 Turbo: скорость для голосовых агентов
Отдельного внимания заслуживает версия Turbo, предназначенная для real-time сценариев: обслуживание клиентов, голосовые персонажи в играх, разговорные AI-агенты. ElevenLabs заявляет, что время до начала произнесения первого слышимого звука (time-to-first-speech) составляет около 150 миллисекунд. Для сравнения, Cartesia Sonic 3.6, по данным ElevenLabs, показывает 262 мс, а OpenAI GPT-4o mini TTS — 814 мс. Компания подчёркивает, что ранее разработчикам голосовых агентов приходилось выбирать между скоростью и выразительностью, и v4 Turbo призван предложить и то, и другое.
Оптимизация Turbo проводилась совместно с платформой ElevenAgents, что указывает на стратегический фокус компании на рынке голосовых AI-агентов.
Позиция на рынке и бенчмарки
По данным независимого агрегатора Artificial Analysis, Eleven v4 занимает первое место в рейтинге Provider Voice Arena, опережая Cartesia Sonic 3.6 и Google Gemini 3.8 Flash TTS. В тестах на произношение (pronunciation benchmark) v4 набрала 91,7%, что значительно выше показателя v3 в 85,6%. В собственных слепых тестах ElevenLabs около трёх четвертей слушателей предпочли v4 моделям от Cartesia, Inworld и Google.
Цены и доступность
Стандартное API-ценообразование: $80 за миллион символов для v4 и $40 для Turbo. До 12 октября 2026 года действуют вводные цены: $22 и $11 за миллион символов соответственно. Для сравнения, Artificial Analysis указывает цену Cartesia Sonic 3.6 в $49 за миллион символов, а Google Gemini 3.8 Flash TTS — в $16,49.
Пользователи тарифа Creator ($22/мес) и выше могут использовать v4 в ElevenCreative без дополнительной платы в течение двух недель, с ограничением в двойной объём ежемесячных кредитов.
Модели доступны в ElevenAgents, ElevenCreative и через API. По умолчанию данные клиентов хранятся в США. Для корпоративных клиентов доступны изолированные среды в ЕС, Индии или Сингапуре, хотя некоторая обработка может происходить за пределами выбранного региона. Для клиентов из ЕС доступен режим обработки API без сохранения данных.
Что это значит для разработчиков и пользователей
Релиз Eleven v4 — это шаг к унификации качества и скорости. Для разработчиков голосовых агентов появление Turbo-версии с заявленными 150 мс означает, что ElevenLabs теперь может конкурировать не только по качеству синтеза, но и по задержкам с решениями вроде Cartesia Sonic. Для контент-мейкеров и студий озвучивания улучшенная консистентность и работа с контекстом сцен упрощают производство аудиокниг и дубляжа.
Однако стоит учитывать, что заявленные показатели основаны на внутренних тестах ElevenLabs и данных Artificial Analysis. Независимые пользовательские тесты в реальных сценариях (например, в длинных диалогах или при работе с шумными аудиоданными) пока не опубликованы. Кроме того, цена $80 за миллион символов для базовой версии выше, чем у некоторых конкурентов, хотя вводные тарифы делают v4 временно более доступной.
Ограничения и что проверить
На данный момент нет независимых исследований, подтверждающих заявления ElevenLabs о консистентности голоса в проектах длительностью более часа или о стабильности акцента при мультиязычном клонировании. Социальные обсуждения на Reddit и Hacker News (включая ветки об OpenAI Audio Models и Voicecraft) в основном фиксируют анонс, но не содержат массовых независимых тестов.
Пользователям стоит обратить внимание на два момента: во-первых, регион обработки данных (по умолчанию США) может быть критичен для некоторых приложений; во-вторых, заявленная скорость Turbo в 150 мс — это время до первого звука, но общая задержка в реальном диалоге зависит также от сети, серверной нагрузки и обработки входного текста. Рекомендуется провести собственные тесты latency в целевой конфигурации перед принятием решения о миграции с v3 или альтернативных решений.






