✅ Подходит: разработчикам и командам, которым нужен API-синтез речи из текста в экосистеме OpenAI, с выбором между скоростью и качеством, а также тем, кто хочет остаться в одном вендоре для TTS и голосовых интерфейсов.
❌ Не подходит: тем, кто ищет готовое пользовательское приложение вместо API, хочет опираться именно на модель с названием «GPT-4o voice», либо не готов учитывать статус Deprecated у gpt-4o-mini-tts.
💡 Ключевое преимущество: у OpenAI есть отдельный Speech API POST /v1/audio/speech, встроенные голоса, режим кастомного голоса по согласию и соседние voice-модели для realtime-агентов — но это не одна модель, а несколько разных путей.
Если вы пришли по запросу OpenAI TTS (GPT-4o voice), главное уточнение такое: в текущем публичном каталоге OpenAI нет одной активной модели буквально с таким названием. Для чистого text-to-speech через /v1/audio/speech сейчас подтверждены tts-1 и tts-1-hd; gpt-4o-mini-tts endpoint всё ещё принимает, но страница модели уже помечает его как Deprecated.
- Разработчик: OpenAI
- Тип: API
- Официальный URL: OpenAI Audio API Reference
- Дата проверки: 13.08.2026
Редакционный вердикт: если вам нужен именно пакетный синтез речи из текста, практичнее стартовать с
tts-1илиtts-1-hd, потому что они не помечены Deprecated. Если нужен голосовой агент с аудио на входе и выходе, смотреть стоит уже наGPT-Realtime-1.5илиgpt-audio-1.5. Это интерпретация по текущему каталогу моделей, а не прямая формулировка OpenAI.
Что умеет
- Генерировать речь через отдельный Speech API:
POST https://api.openai.com/v1/audio/speech. - Возвращать результат как аудиофайл или поток аудиособытий; в официальном примере синтез проверяется записью результата в
speech.mp3. - Принимать для Speech API модели
tts-1,tts-1-hd,gpt-4o-mini-ttsи снапшотgpt-4o-mini-tts-2025-12-15. - Использовать встроенные голоса:
alloy,ash,ballad,coral,echo,fable,onyx,nova,sage,shimmer,verse,marinиcedar. - Поддерживать кастомный голос: для создания нужен аудиосэмпл и заранее загруженная запись согласия; доступно только eligible customers.
- В случае
gpt-4o-mini-tts— управлять тем, как модель говорит: OpenAI отдельно представляла эту модель как TTS с задаваемой манерой речи, но сейчас она уже помечена Deprecated.
Как использовать
- Определите сценарий. Если нужен просто text-to-speech, выбирайте между
tts-1иtts-1-hd. Если вам нужен не синтезатор, а голосовой агент с аудио-входом и аудио-выходом, это уже другой класс моделей. - Подготовьте текст и голос. Для базового сценария достаточно текста и одного из встроенных голосов. Если вы только настраиваете доступ к API, пригодится наш гайд как подключить OpenAI API и отправить первый запрос.
- Отправьте запрос в Speech API. Используйте endpoint
/v1/audio/speechиз вашего приложения или через официальный SDK. В источниках подтверждены официальные библиотеки для Python и JavaScript/TypeScript. - Сохраните результат. Документация прямо показывает сценарий, где ответ записывается в
speech.mp3; также endpoint может возвращать поток аудиособытий. - Если нужен кастомный голос, готовьте комплаенс заранее. OpenAI требует аудиосэмпл и предварительно загруженную запись согласия, а сама возможность ограничена eligible customers.
Практический workflow здесь простой: текст → выбор модели → выбор голоса → запрос в /v1/audio/speech → сохранение файла или обработка стрима. Это хороший вариант для озвучки уведомлений, автоответов, voice-over в продукте и других API-сценариев без отдельного GUI.
Тарифы и ограничения
У OpenAI TTS нет «тарифов» в смысле готовых пользовательских планов внутри этого инструмента; в публичных источниках подтверждена помодельная оплата API-использования. Ниже — то, что можно зафиксировать по предоставленному пакету.
| Модель | Цена | Лимиты и примечания |
|---|---|---|
| TTS-1 | $15.00 за 1 млн символов | Оптимизирована для скорости; работает через Speech API. |
| TTS-1 HD | $30.00 за 1 млн символов | Оптимизирована для качества; работает через Speech API. |
| GPT-4o mini TTS | Смотрите текущую страницу модели | Страница модели помечена Deprecated; текущий alias — gpt-4o-mini-tts-2025-12-15; максимум входа — 2000 токенов. |
Дата проверки: 13.08.2026.
Что важно не перепутать: GPT-Realtime-1.5 и gpt-audio-1.5 — это уже не «чистый TTS» в той же форме, а соседние voice-модели для других сценариев. В текущем каталоге они описаны как лучшие модели для audio in/audio out, но не как прямые замены Speech API один к одному.
Ограничение источников: в пакете нет отдельной сводной pricing page OpenAI с дублирующим подтверждением всех цен, а для
gpt-4o-mini-ttsв выписке не дано точное числовое значение цены. Поэтому перед закупкой или публикацией коммерческого расчёта перепроверьте live-страницы моделей.
Лимиты скорости и актуальные снапшоты OpenAI меняет часто. В предоставленном пакете есть указание, что страницы моделей содержат rate limits, но конкретные числа в выписке не зафиксированы, поэтому здесь их лучше не пересказывать без живой перепроверки.
Работа с данными и приватность
Для базового синтеза речи сервис получает тот текст, который вы отправляете в /v1/audio/speech. Если вы используете кастомный голос, OpenAI дополнительно получает аудиосэмпл и ранее загруженную запись согласия.
- Что видит сервис: текст запроса; при кастомном голосе — аудиосэмпл и consent recording.
- Использование для обучения: в предоставленном пакете это явно не раскрыто, поэтому честный статус — не подтверждено по этим источникам.
- Где и как применяются региональные ограничения: страница Data controls прямо включает
/v1/audio/speechв поддерживаемые аудио-endpoint’ы и указывает, что использование вне США требует дополнительного approval и контролей, связанных с Zero Data Retention. - Где хранятся данные: точный регион хранения по этой выписке не фиксируется; для non-US сценариев нужны дополнительные согласования.
Если у вас высокие требования к комплаенсу, privacy review или AI Safety, не ограничивайтесь одной документацией Speech API. Для корпоративного сценария полезно отдельно сравнить Azure OpenAI и OpenAI напрямую, потому что вопросы доступа к моделям и контролей данных там влияют на архитектурное решение.
Практический вывод: OpenAI даёт официальный путь для consent-based custom voice, что лучше, чем «серое» клонирование без согласия. Но если вам нужна жёсткая ясность по региону хранения, тренировочным политикам и биллингу для конкретной юрисдикции, одних источников из этого пакета недостаточно.
Плюсы и минусы
Плюсы
- Есть отдельный официальный Speech API endpoint, а не только экспериментальные голосовые режимы внутри чата.
- Понятное разделение по задачам:
tts-1для скорости,tts-1-hdдля качества. - Список встроенных голосов достаточно широкий уже «из коробки», без обязательного обучения своей voice-модели.
- Поддержан кастомный голос через explicit consent workflow, а не безусловное клонирование.
- Есть официальные SDK для Python и JavaScript/TypeScript, что упрощает интеграцию.
Минусы
- Название «GPT-4o voice» вводит в заблуждение: одной текущей модели с таким буквальным именем в каталоге нет.
gpt-4o-mini-ttsвсё ещё принимается endpoint’ом, но уже помечена как Deprecated, что делает её слабой ставкой для нового продакшена.- У
gpt-4o-mini-ttsзафиксирован максимум входа 2000 токенов. - Для регионального использования вне США нужны дополнительные approval и Zero Data Retention-related controls.
- Статус оплаты, сетевой доступности и практической работы из РФ в предоставленных источниках прямо не подтверждён.
Доступность и язык
- Платформы: API; в источниках подтверждены официальные SDK для Python и JavaScript/TypeScript.
- Русский язык интерфейса: в предоставленном пакете нет подтверждения отдельного русскоязычного интерфейса TTS-продукта; речь идёт о документации и API-эндпоинтах OpenAI.
- Русский язык озвучки: в пакете нет официального списка поддерживаемых языков или качества по русскому, поэтому обещать результат без собственного теста нельзя.
- Доступность для РФ: официально по этому пакету не подтверждена ни работа без VPN, ни статус оплаты. Честный вывод: перепроверьте доступ к аккаунту, биллинг и сеть перед внедрением.
- Способы оплаты: в предоставленных источниках не раскрыты.
Альтернативы
- TTS-1 — базовый выбор внутри OpenAI, если для вас важнее скорость и цена, чем максимальное качество.
- TTS-1 HD — вариант внутри OpenAI, если вы готовы платить больше ради качества синтеза.
- GPT-Realtime-1.5 — не чистый TTS, а модель для realtime audio in/audio out, если вы строите голосового агента.
- gpt-audio-1.5 — не прямой аналог Speech API, а путь для audio in/audio out через Chat Completions.
- Если вы сравниваете OpenAI со специализированным TTS-вендором, посмотрите наш материал ElevenLabs vs OpenAI TTS.
Если вам нужен не только синтез речи, а выбор API-вендора шире, может пригодиться и сравнение OpenAI API vs Anthropic API. Но для узкой TTS-задачи полезнее сначала решить, нужен ли вам именно pure TTS, realtime voice agent или audio in/audio out в Chat Completions.
Источники
- Audio | OpenAI API Reference
- GPT-4o mini TTS Model | OpenAI API
- TTS-1 Model | OpenAI API
- TTS-1 HD Model | OpenAI API
- All models | OpenAI API
- Data controls in the OpenAI platform – OpenAI API
- Introducing our next generation audio models in the API | OpenAI
- GitHub – openai/openai-python
- GitHub – openai/openai-node
Вопросы и ответы
Есть ли сейчас модель OpenAI с буквальным названием GPT-4o voice?
Нет. По текущему каталогу voice-возможности разделены между TTS-моделями, realtime-моделью и audio-моделью для Chat Completions. Для pure TTS через Speech API подтверждены tts-1 и tts-1-hd; gpt-4o-mini-tts ещё принимается, но уже помечена Deprecated.
Что выбрать для обычной озвучки текста?
Практически — tts-1, если важнее скорость и цена, и tts-1-hd, если важнее качество. Это редакционный вывод по текущим страницам моделей и статусу Deprecated у gpt-4o-mini-tts.
Можно ли всё ещё использовать gpt-4o-mini-tts?
Да, Speech API всё ещё принимает эту модель и её текущий alias, но страница модели помечена Deprecated. Кроме того, в источниках зафиксирован максимум 2000 входных токенов.
Можно ли создать свой голос?
Да, но только по официальному consent-based workflow: нужен аудиосэмпл и ранее загруженная запись согласия. Документация также говорит, что кастомные голоса доступны только eligible customers.
Что известно про приватность, регионы и РФ?
Data controls page включает /v1/audio/speech в поддерживаемые audio-endpoint’ы и указывает дополнительные условия для non-US использования. Но в предоставленном пакете нет полной ясности по тренировочным политикам, региону хранения, оплате и доступности из РФ, поэтому эти пункты нужно перепроверять отдельно перед продакшеном.