TTS (Text-to-Speech) — это технология, которая превращает текст или SSML в аудиоданные с синтетической человеческой речью. Проще говоря, вы передаёте строку текста, а система возвращает озвучку; по состоянию на 2026-08-16 это обычно делается через облачные API или open-source модели.
Английский термин: text-to-speech, сокращение TTS. По-русски обычно говорят «синтез речи» или «озвучивание текста». В документации провайдеров рядом с TTS часто встречаются SSML, custom voice, voice engine, realtime synthesis и batch synthesis.
Простыми словами
Можно представить TTS как очень быстрый цифровой диктор. Вы отдаёте ему готовый текст, а он читает его вслух выбранным голосом.
Это именно озвучивание текста, а не понимание смысла на человеческом уровне. Качество зависит от модели, голоса, региона, режима работы и того, насколько точно вы подготовили текст или SSML.
Как это работает
На уровне сервиса схема выглядит просто: входом служит текст или SSML, выходом — аудиофайл или поток. В современных нейросетевых системах внутри часто есть промежуточный акустический этап: например, в Tacotron 2 сначала предсказывается mel-спектрограмма, а затем она преобразуется в аудиосигнал; FastSpeech 2 и VITS предлагают другие нейросетевые варианты той же задачи. В репозитории Coqui TTS есть реализации Tacotron, Tacotron2, FastSpeech2, VITS и связанных подходов.
Текст / SSML
↓
Нормализация и разметка входа
↓
Акустическое представление речи
↓
Генерация аудиосигнала
↓
Файл или поток с речью
- Вход: вы передаёте обычный текст или SSML.
- Подготовка: система разбирает вход, пунктуацию и управляющие элементы.
- Синтез: модель строит акустическое представление будущей фразы.
- Вокализация: следующий этап превращает это представление в слышимый аудиосигнал.
- Выдача: API возвращает результат в реальном времени или пакетно, в зависимости от режима.
Если вам нужен именно низкий отклик, OpenAI прямо указывает, что tts-1 оптимизирован для realtime-сценариев и используется через Speech endpoint в Audio API. Если же важны длинные аудио, Azure описывает отдельный batch synthesis для материалов длиннее 10 минут, а в Amazon Polly есть отдельный класс движков Long-form.
Где применяется
- Голосовые интерфейсы с низкой задержкой. Для такого сценария OpenAI выделяет
tts-1как модель, оптимизированную под realtime text-to-speech. - Длинная озвучка. В Azure для аудио длиннее 10 минут описан batch synthesis, а в Polly среди движков есть Long-form.
- Корпоративные развёртывания с требованиями к региону. У Google Cloud есть regional endpoints, которые, по документации, могут удерживать данные at rest и in use в границах Европы или США.
- Стандартные и пользовательские голоса. Azure разделяет standard и custom voices, а Google в актуальном каталоге указывает Chirp 3: Instant Custom Voice.
Практически это означает следующее: один и тот же термин TTS покрывает и «говорящего ассистента», и пакетную озвучку длинного текста, и более сложные корпоративные сценарии, где важны регион и тип голоса.
Практический пример
Сценарий: вам нужно озвучить инструкцию для пользователя и не ошибиться с режимом, регионом и расчётом стоимости.
- Подготовьте исходный текст. Если сервис поддерживает SSML и вам нужен управляемый ввод, используйте SSML вместо «голого» текста.
- Проверьте длину материала. Если итоговое аудио длиннее 10 минут, в Azure для этого есть batch synthesis; для AWS стоит отдельно проверить Long-form и региональную доступность.
- Если важна привязка данных к региону, проверьте regional endpoint. У Google такие endpoint’ы могут удерживать данные в пределах Европы или США, но каталог моделей и голосов при этом зависит от региона.
- Проверьте, как считается биллинг. У Google он идёт по символам, включая пробелы, переводы строк и SSML-теги, кроме
<mark>. У Azure SSML тоже тарифицируется, кроме<speak>и<voice>. У OpenAI дляtts-1иtts-1-hdуказана цена за 1 миллион символов. - Только после этого выбирайте модель или движок: realtime, long-form, standard, neural, generative или custom voice — в зависимости от задачи.
Минимальный пример входа, если провайдер принимает SSML:
<speak>
Здравствуйте. Это проверка синтеза речи.
</speak>
Для OpenAI важно отдельно учесть ограничения доступа: API поддерживается только в перечисленных странах и территориях, а на бесплатном уровне для генерации речи указаны лимиты 3 запроса в минуту и 200 запросов в день.
Чем отличается от…
| Термин | Что это | Чем отличается от TTS |
|---|---|---|
| TTS | Преобразование текста или SSML в речь | Базовая задача: на входе текст, на выходе звук |
| Custom voice | Режим работы не со стандартным, а с пользовательским голосом | Это не отдельная задача вместо TTS, а вариант того, каким голосом выполняется TTS; доступность ограничена у Azure и зависит от региона |
| Voice engine | Семейство движков или способ синтеза внутри сервиса | В Amazon Polly TTS может выполняться разными движками: Generative, Long-form, Neural, Standard |
| Batch synthesis | Пакетный режим синтеза для длинных материалов | Это не другой тип технологии, а другой режим выполнения TTS; в Azure он описан для аудио длиннее 10 минут |
Ключевые подходы и текущие сервисы
| Сервис | Что подтверждено в источниках | Практическая оговорка |
|---|---|---|
| OpenAI | tts-1 оптимизирован для realtime; модель используется через Speech endpoint в Audio API. Для tts-1 указано US$15 за 1 млн символов, для tts-1-hd — US$30. В анонсе от 2025-03-20 добавлен gpt-4o-mini-tts с инструкциями по манере речи при использовании preset/artificial voices. |
Доступ зависит от списка поддерживаемых стран и территорий; лимиты запросов зависят от уровня доступа. |
| Google Cloud Text-to-Speech | Преобразует текст или SSML в речь. На regional endpoints перечислены Gemini 2.5 Flash TTS, Gemini 2.5 Pro TTS, Chirp 3: HD voices и Chirp 3: Instant Custom Voice. Для Chirp 3: HD voices указано бесплатно до 1 млн символов, далее US$0.00003 за символ; Instant Custom Voice — US$0.00006 за символ. | Список голосов и моделей зависит от региона; биллинг включает пробелы, переводы строк и SSML-теги, кроме <mark>. |
| Amazon Polly | Есть четыре движка: Generative, Long-form, Neural и Standard. Для generative engine документация указывает 43 голоса. | Generative voices доступны только в отдельных регионах и не поддерживают newscaster speaking style и speech marks. |
| Azure AI Speech | Поддерживает standard и custom voices, realtime synthesis через SDK или REST, а также batch synthesis для аудио длиннее 10 минут. Для standard voices указано 100+ languages/locales. | Custom voice доступен ограниченно; обучение и размещение custom voice тарифицируются по часам, с лимитом 96 compute-hours на training или hosting, и доступны не во всех регионах. |
| Coqui TTS | Open-source toolkit с pretrained models в 1100+ языках и инструментами для training и fine-tuning. | Это репозиторий, а не managed service: вам придётся самостоятельно хостить и сопровождать систему. |
В качестве практического ориентира: если вам нужен быстрый API-вызов для коротких реплик, смотрите на realtime TTS; если длинные материалы — проверяйте batch/long-form; если нужен полный контроль над моделью и обучением — открытые тулкиты вроде Coqui TTS могут подойти лучше, но цена вопроса смещается из «тарифа за символ» в инфраструктуру и MLOps.
Ограничения и заблуждения
- Заблуждение: «TTS всегда означает клонирование голоса». На практике: нет. Например, OpenAI в анонсе новых аудиомоделей говорит о preset/artificial voices и управлении манерой речи, а не о произвольном копировании голоса.
- Заблуждение: «Если сервис называется облачным TTS, то все голоса доступны везде». На практике: у Google, AWS и Azure есть региональные различия; у OpenAI есть список поддерживаемых стран и территорий.
- Заблуждение: «Стоимость считается только по видимому тексту». На практике: правила зависят от провайдера. У Google в расчёт входят пробелы, переводы строк и SSML-теги, кроме
<mark>; у Azure SSML тоже тарифицируется, кроме<speak>и<voice>. - Ограничение: качество, набор голосов и функции зависят не только от модели, но и от режима. В Polly generative voices, например, не поддерживают newscaster speaking style и speech marks.
- Ограничение: open-source TTS даёт больше контроля, но не избавляет от задач развёртывания, обучения и сопровождения.
Редакционное ограничение: в этом материале нет субъективного рейтинга «лучшего качества голоса» и нет единой таблицы latency/MOS по всем системам, потому что в предоставленном пакете источников нет сопоставимого независимого бенчмарка для всех перечисленных сервисов.
Связанные материалы COMRAD404
- OpenAI TTS (GPT-4o voice) — API для синтеза речи
- ElevenLabs vs OpenAI TTS: что выбрать для синтеза речи
- VALL-E / Azure Neural TTS — что реально доступно
- Лучшие TTS-модели с клонированием голоса: 6 проверенных вариантов
Источники
- TTS-1 Model | OpenAI API
- Introducing our next-generation audio models
- OpenAI API – Supported Countries and Territories | OpenAI Help Center
- Cloud Text-to-Speech documentation | Google Cloud Documentation
- Specify a regional endpoint | Cloud Text-to-Speech | Google Cloud Documentation
- Review pricing for Text-to-Speech | Google Cloud
- Amazon Polly voice engines – Amazon Polly
- Generative voices – Amazon Polly
- What is text to speech? – Speech service – Foundry Tools | Microsoft Learn
- Text to speech API reference (REST) – Speech service – Foundry Tools | Microsoft Learn
- GitHub – coqui-ai/TTS
- Natural TTS Synthesis by Conditioning WaveNet on Mel Spectrogram Predictions
- FastSpeech 2: Fast and High-Quality End-to-End Text to Speech
- Conditional Variational Autoencoder with Adversarial Learning for End-to-End Text-to-Speech
Вопросы и ответы
TTS и custom voice — это одно и то же?
Нет. TTS — это сама задача преобразования текста в речь. Custom voice — это вариант того, каким голосом выполняется синтез; доступность такой функции у некоторых провайдеров ограничена и зависит от региона.
Как обычно считается стоимость TTS?
У крупных облачных сервисов часто используется расчёт по символам, но правила различаются. OpenAI публикует цену за 1 млн символов, Google считает символы с пробелами, переводами строк и SSML-тегами, кроме <mark>, а Azure тоже тарифицирует SSML, кроме <speak> и <voice>.
Можно ли синтезировать длинные аудио одним и тем же способом, что и короткие?
Не всегда. Azure отдельно описывает batch synthesis для аудио длиннее 10 минут, а в Amazon Polly есть движок Long-form. Для длинных материалов лучше сразу проверять именно этот режим, а не только обычный realtime API.
Будет ли одна и та же модель доступна в любой стране и регионе?
Нет. OpenAI ограничивает доступ списком поддерживаемых стран и территорий, а Google, AWS и Azure публикуют региональные матрицы доступности голосов, моделей и отдельных функций.
Coqui TTS — это готовый облачный сервис?
Нет. В источниках Coqui TTS — это open-source toolkit с моделями и кодом для обучения и fine-tuning. Если вам нужен managed service, его придётся искать отдельно или разворачивать самостоятельно.