COMRAD404 / GLOSSARY

TTS (Text-to-Speech)

Text-to-Speech (TTS)

TTS (Text-to-Speech) — это преобразование текста или SSML в синтетическую речь. Разбираем, как работает синтез речи, где он применяется, чем отличается от custom voice и что важно проверить у API и open-source решений.

TL;DR

Преобразование текста или SSML в синтетическую речь с помощью облачного API или модели синтеза.

TTS (Text-to-Speech) — это технология, которая превращает текст или SSML в аудиоданные с синтетической человеческой речью. Проще говоря, вы передаёте строку текста, а система возвращает озвучку; по состоянию на 2026-08-16 это обычно делается через облачные API или open-source модели.

Английский термин: text-to-speech, сокращение TTS. По-русски обычно говорят «синтез речи» или «озвучивание текста». В документации провайдеров рядом с TTS часто встречаются SSML, custom voice, voice engine, realtime synthesis и batch synthesis.

Простыми словами

Можно представить TTS как очень быстрый цифровой диктор. Вы отдаёте ему готовый текст, а он читает его вслух выбранным голосом.

Это именно озвучивание текста, а не понимание смысла на человеческом уровне. Качество зависит от модели, голоса, региона, режима работы и того, насколько точно вы подготовили текст или SSML.

Как это работает

На уровне сервиса схема выглядит просто: входом служит текст или SSML, выходом — аудиофайл или поток. В современных нейросетевых системах внутри часто есть промежуточный акустический этап: например, в Tacotron 2 сначала предсказывается mel-спектрограмма, а затем она преобразуется в аудиосигнал; FastSpeech 2 и VITS предлагают другие нейросетевые варианты той же задачи. В репозитории Coqui TTS есть реализации Tacotron, Tacotron2, FastSpeech2, VITS и связанных подходов.

Текст / SSML
      ↓
Нормализация и разметка входа
      ↓
Акустическое представление речи
      ↓
Генерация аудиосигнала
      ↓
Файл или поток с речью
  1. Вход: вы передаёте обычный текст или SSML.
  2. Подготовка: система разбирает вход, пунктуацию и управляющие элементы.
  3. Синтез: модель строит акустическое представление будущей фразы.
  4. Вокализация: следующий этап превращает это представление в слышимый аудиосигнал.
  5. Выдача: API возвращает результат в реальном времени или пакетно, в зависимости от режима.

Если вам нужен именно низкий отклик, OpenAI прямо указывает, что tts-1 оптимизирован для realtime-сценариев и используется через Speech endpoint в Audio API. Если же важны длинные аудио, Azure описывает отдельный batch synthesis для материалов длиннее 10 минут, а в Amazon Polly есть отдельный класс движков Long-form.

Где применяется

  • Голосовые интерфейсы с низкой задержкой. Для такого сценария OpenAI выделяет tts-1 как модель, оптимизированную под realtime text-to-speech.
  • Длинная озвучка. В Azure для аудио длиннее 10 минут описан batch synthesis, а в Polly среди движков есть Long-form.
  • Корпоративные развёртывания с требованиями к региону. У Google Cloud есть regional endpoints, которые, по документации, могут удерживать данные at rest и in use в границах Европы или США.
  • Стандартные и пользовательские голоса. Azure разделяет standard и custom voices, а Google в актуальном каталоге указывает Chirp 3: Instant Custom Voice.

Практически это означает следующее: один и тот же термин TTS покрывает и «говорящего ассистента», и пакетную озвучку длинного текста, и более сложные корпоративные сценарии, где важны регион и тип голоса.

Практический пример

Сценарий: вам нужно озвучить инструкцию для пользователя и не ошибиться с режимом, регионом и расчётом стоимости.

  1. Подготовьте исходный текст. Если сервис поддерживает SSML и вам нужен управляемый ввод, используйте SSML вместо «голого» текста.
  2. Проверьте длину материала. Если итоговое аудио длиннее 10 минут, в Azure для этого есть batch synthesis; для AWS стоит отдельно проверить Long-form и региональную доступность.
  3. Если важна привязка данных к региону, проверьте regional endpoint. У Google такие endpoint’ы могут удерживать данные в пределах Европы или США, но каталог моделей и голосов при этом зависит от региона.
  4. Проверьте, как считается биллинг. У Google он идёт по символам, включая пробелы, переводы строк и SSML-теги, кроме <mark>. У Azure SSML тоже тарифицируется, кроме <speak> и <voice>. У OpenAI для tts-1 и tts-1-hd указана цена за 1 миллион символов.
  5. Только после этого выбирайте модель или движок: realtime, long-form, standard, neural, generative или custom voice — в зависимости от задачи.

Минимальный пример входа, если провайдер принимает SSML:

<speak>
  Здравствуйте. Это проверка синтеза речи.
</speak>

Для OpenAI важно отдельно учесть ограничения доступа: API поддерживается только в перечисленных странах и территориях, а на бесплатном уровне для генерации речи указаны лимиты 3 запроса в минуту и 200 запросов в день.

Чем отличается от…

Термин Что это Чем отличается от TTS
TTS Преобразование текста или SSML в речь Базовая задача: на входе текст, на выходе звук
Custom voice Режим работы не со стандартным, а с пользовательским голосом Это не отдельная задача вместо TTS, а вариант того, каким голосом выполняется TTS; доступность ограничена у Azure и зависит от региона
Voice engine Семейство движков или способ синтеза внутри сервиса В Amazon Polly TTS может выполняться разными движками: Generative, Long-form, Neural, Standard
Batch synthesis Пакетный режим синтеза для длинных материалов Это не другой тип технологии, а другой режим выполнения TTS; в Azure он описан для аудио длиннее 10 минут

Ключевые подходы и текущие сервисы

Сервис Что подтверждено в источниках Практическая оговорка
OpenAI tts-1 оптимизирован для realtime; модель используется через Speech endpoint в Audio API. Для tts-1 указано US$15 за 1 млн символов, для tts-1-hd — US$30. В анонсе от 2025-03-20 добавлен gpt-4o-mini-tts с инструкциями по манере речи при использовании preset/artificial voices. Доступ зависит от списка поддерживаемых стран и территорий; лимиты запросов зависят от уровня доступа.
Google Cloud Text-to-Speech Преобразует текст или SSML в речь. На regional endpoints перечислены Gemini 2.5 Flash TTS, Gemini 2.5 Pro TTS, Chirp 3: HD voices и Chirp 3: Instant Custom Voice. Для Chirp 3: HD voices указано бесплатно до 1 млн символов, далее US$0.00003 за символ; Instant Custom Voice — US$0.00006 за символ. Список голосов и моделей зависит от региона; биллинг включает пробелы, переводы строк и SSML-теги, кроме <mark>.
Amazon Polly Есть четыре движка: Generative, Long-form, Neural и Standard. Для generative engine документация указывает 43 голоса. Generative voices доступны только в отдельных регионах и не поддерживают newscaster speaking style и speech marks.
Azure AI Speech Поддерживает standard и custom voices, realtime synthesis через SDK или REST, а также batch synthesis для аудио длиннее 10 минут. Для standard voices указано 100+ languages/locales. Custom voice доступен ограниченно; обучение и размещение custom voice тарифицируются по часам, с лимитом 96 compute-hours на training или hosting, и доступны не во всех регионах.
Coqui TTS Open-source toolkit с pretrained models в 1100+ языках и инструментами для training и fine-tuning. Это репозиторий, а не managed service: вам придётся самостоятельно хостить и сопровождать систему.

В качестве практического ориентира: если вам нужен быстрый API-вызов для коротких реплик, смотрите на realtime TTS; если длинные материалы — проверяйте batch/long-form; если нужен полный контроль над моделью и обучением — открытые тулкиты вроде Coqui TTS могут подойти лучше, но цена вопроса смещается из «тарифа за символ» в инфраструктуру и MLOps.

Ограничения и заблуждения

  • Заблуждение: «TTS всегда означает клонирование голоса». На практике: нет. Например, OpenAI в анонсе новых аудиомоделей говорит о preset/artificial voices и управлении манерой речи, а не о произвольном копировании голоса.
  • Заблуждение: «Если сервис называется облачным TTS, то все голоса доступны везде». На практике: у Google, AWS и Azure есть региональные различия; у OpenAI есть список поддерживаемых стран и территорий.
  • Заблуждение: «Стоимость считается только по видимому тексту». На практике: правила зависят от провайдера. У Google в расчёт входят пробелы, переводы строк и SSML-теги, кроме <mark>; у Azure SSML тоже тарифицируется, кроме <speak> и <voice>.
  • Ограничение: качество, набор голосов и функции зависят не только от модели, но и от режима. В Polly generative voices, например, не поддерживают newscaster speaking style и speech marks.
  • Ограничение: open-source TTS даёт больше контроля, но не избавляет от задач развёртывания, обучения и сопровождения.

Редакционное ограничение: в этом материале нет субъективного рейтинга «лучшего качества голоса» и нет единой таблицы latency/MOS по всем системам, потому что в предоставленном пакете источников нет сопоставимого независимого бенчмарка для всех перечисленных сервисов.

Связанные материалы COMRAD404

Источники

Вопросы и ответы

TTS и custom voice — это одно и то же?

Нет. TTS — это сама задача преобразования текста в речь. Custom voice — это вариант того, каким голосом выполняется синтез; доступность такой функции у некоторых провайдеров ограничена и зависит от региона.

Как обычно считается стоимость TTS?

У крупных облачных сервисов часто используется расчёт по символам, но правила различаются. OpenAI публикует цену за 1 млн символов, Google считает символы с пробелами, переводами строк и SSML-тегами, кроме <mark>, а Azure тоже тарифицирует SSML, кроме <speak> и <voice>.

Можно ли синтезировать длинные аудио одним и тем же способом, что и короткие?

Не всегда. Azure отдельно описывает batch synthesis для аудио длиннее 10 минут, а в Amazon Polly есть движок Long-form. Для длинных материалов лучше сразу проверять именно этот режим, а не только обычный realtime API.

Будет ли одна и та же модель доступна в любой стране и регионе?

Нет. OpenAI ограничивает доступ списком поддерживаемых стран и территорий, а Google, AWS и Azure публикуют региональные матрицы доступности голосов, моделей и отдельных функций.

Coqui TTS — это готовый облачный сервис?

Нет. В источниках Coqui TTS — это open-source toolkit с моделями и кодом для обучения и fine-tuning. Если вам нужен managed service, его придётся искать отдельно или разворачивать самостоятельно.

Источники

SOURCES

Вопросы и ответы

FAQ
TTS и custom voice — это одно и то же?

Нет. TTS — это задача преобразования текста в речь. Custom voice — это вариант того, каким голосом выполняется синтез; доступность такой функции у некоторых провайдеров ограничена и зависит от региона.

Как обычно считается стоимость TTS?

У облачных сервисов часто используется расчёт по символам, но правила различаются. OpenAI публикует цену за 1 млн символов, Google считает символы с пробелами, переводами строк и SSML-тегами, кроме <mark>, а Azure тоже тарифицирует SSML, кроме и .

Можно ли синтезировать длинные аудио тем же способом, что и короткие?

Не всегда. Azure отдельно описывает batch synthesis для аудио длиннее 10 минут, а в Amazon Polly есть движок Long-form. Для длинных материалов лучше сразу проверять именно этот режим.

Будет ли одна и та же модель доступна в любой стране и регионе?

Нет. OpenAI ограничивает доступ списком поддерживаемых стран и территорий, а Google, AWS и Azure публикуют региональные матрицы доступности голосов, моделей и отдельных функций.

Coqui TTS — это готовый облачный сервис?

Нет. В источниках Coqui TTS — это open-source toolkit с моделями и кодом для обучения и fine-tuning. Если нужен managed service, его придётся искать отдельно или разворачивать самостоятельно.

Читайте также

LINKS