Запись архива

Google представила Gemini 3.8 Flash TTS с библиотекой из более чем 2000 голосов

Google выпустила две модели синтеза речи — Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. По данным разработчика Саймона Уиллисона, API поддерживает более 2000 голосов, пользовательские голоса на основе 30-секундной записи и диалоги с несколькими персонажами.

Интерфейс Gemini 3.8 TTS Playground с настройками голосов и многоперсонажного диалога
Интерфейс Gemini 3.8 TTS Playground с настройками голосов и многоперсонажного диалога
Visit of Ursula von der Leyen, President of the European Commission, to India (P-065755-00-37).jpg | by Europäische Kommission — Audiovisueller Dienst, CE — Service audiovisuel, EC — Audiovisual Service, Dati Bendo | wikimedia_commons | CC BY 4.0

23 сентября 2026 года Google представила две модели синтеза речи: Gemini 3.8 Flash TTS и Gemini 3.8 Flash-Lite TTS. О запуске сообщил разработчик и автор Simon Willison, опубликовавший собственный интерфейс для тестирования моделей через Gemini API.

Главная особенность новинок — библиотека из более чем 2000 голосов и возможность создать пользовательский голос на основе 30-секундного аудиосэмпла. Google, согласно описанию, требует, чтобы пользователь имел право использовать исходный голос. Подробности о проверке таких прав и защитных ограничениях в исходном сообщении не раскрываются.

Обе модели относятся к инструментам text-to-speech, то есть преобразуют текст в речь. Flash обозначает основную модель, а Flash-Lite — более экономичный вариант. При этом в доступном описании нет независимого сравнения качества, задержки или точных тарифов между двумя версиями.

Что изменилось в Gemini API

API позволяет задавать не только текст и голос, но и сценарий разговора между несколькими персонажами. Для каждого участника можно выбрать отдельный голос и добавить инструкции о манере речи. Такой подход избавляет разработчика от необходимости вручную собирать диалог из отдельных аудиофрагментов.

Для приложений это означает более простой способ создавать озвученные сценки, подкастовые вставки, обучающие материалы и прототипы голосовых интерфейсов. Однако сама поддержка многоперсонажных сценариев не означает автоматического решения всех задач: разработчику по-прежнему нужно контролировать очередность реплик, длительность пауз, произношение имен и устойчивость выбранной интонации.

Уиллисон также отметил открытую политику CORS у используемого API. Благодаря этому браузерный интерфейс может обращаться к сервису напрямую. Его playground построен по модели bring-your-own-key: пользователь должен указать собственный ключ API, а не передавать доступ к аккаунту создателю инструмента.

Официальная документация Gemini API доступна на сайте Google для разработчиков. Перед использованием браузерного playground разработчикам стоит отдельно проверить, где хранится ключ и какие ограничения действуют для выбранного проекта.

Демонстрация с двумя пеликанами

В качестве демонстрации Simon Willison сгенерировал диалог двух пеликанов, которые обсуждают переезд к Pacifica Pier. Сценарий подготовил Claude 4.5 Opus, после чего его использовали для формирования запроса к интерфейсу.

Аудиозапись длится 1 минуту 18 секунд. По словам Уиллисона, генерация на Gemini 3.8 Flash TTS заняла около 20 секунд и стоила 2,74 цента. Это не универсальный тариф за минуту, а результат одной конкретной операции. Если разделить указанную сумму на длительность записи, получится приблизительно 2,1 цента за минуту, но такая оценка не заменяет официальную таблицу цен и может зависеть от объема входного текста, режима API и условий тестового доступа.

Актуальные тарифы следует сверять в разделе цен Gemini API, а не переносить стоимость этой демонстрации на производственное приложение. В исходном материале отдельно указано, что использовалась Flash-версия, а не Flash-Lite.

Где это может пригодиться разработчикам

Поддержка нескольких голосов в одном запросе особенно интересна для приложений, где речь является частью сценария, а не простым чтением текста. К таким задачам относятся:

  • прототипы подкастов и аудиосцен;
  • обучающие диалоги и симуляции собеседований;
  • голосовые интерфейсы с несколькими ролями;
  • черновая озвучка видео и презентаций;
  • интерактивные истории и игровые прототипы.

Библиотека из более чем 2000 голосов расширяет выбор по сравнению с сервисами, где разработчик работает с небольшим фиксированным набором дикторов. Но это число само по себе не показывает, сколько голосов доступно для конкретного языка, какие варианты имеют нужный акцент и насколько стабильно модель сохраняет тембр на длинном тексте.

То же относится к пользовательским голосам. Возможность использовать 30-секундную запись снижает порог для прототипирования, однако короткого сэмпла недостаточно, чтобы заранее оценить результат на сложной терминологии, эмоциональной речи или длинных диалогах. Для коммерческого использования дополнительно потребуется проверить согласие владельца голоса и правила самого API.

Что пока нельзя считать доказанным

Демонстрация Уиллисона подтверждает, что описанный сценарий можно быстро собрать и получить аудиофайл. Она не является независимым тестом качества Gemini 3.8 Flash TTS. По одному англоязычному диалогу нельзя сделать вывод о работе модели с русским языком, диалектами, именами собственными или профессиональной лексикой.

Не подтверждены и несколько практических параметров: полный список языков, доступность конкретных голосов, стабильность пользовательского клонирования, лимиты запросов и различия в качестве между Flash и Flash-Lite. В доступном описании также нет независимого сравнения с ElevenLabs, Azure Speech или другими TTS-сервисами, поэтому заявления о превосходстве или более выгодной цене были бы преждевременными.

Открытая CORS-политика удобна для демонстраций, но не делает безопасным размещение секретного ключа в клиентском коде. При создании реального приложения ключ следует защищать на серверной стороне или использовать предусмотренный Google механизм временного доступа. Кроме того, браузерный интерфейс нужно проверять отдельно: наличие playground не означает, что он является официальным продуктом Google.

Для первого теста разработчику имеет смысл взять один и тот же короткий сценарий, прогнать его через Flash и Flash-Lite, затем сравнить задержку, стоимость, произношение и устойчивость голоса в нескольких дублях. Такой эксперимент даст более полезный результат, чем переносить на проект цену демонстрации в 2,74 цента или ориентироваться только на заявленное количество голосов.

Подробности исходного эксперимента опубликованы в заметке Simon Willison о Gemini 3.8 TTS Playground. Пока это запуск с убедительной демонстрацией возможностей API, но не завершенная оценка готовности моделей для production-сценариев.

Источники