COMRAD404 / TOOL

OpenAI TTS (GPT-4o voice) — API для синтеза речи

OpenAI TTS в 2026 — это не одна модель «GPT-4o voice», а несколько voice-режимов: tts-1, tts-1-hd, deprecated gpt-4o-mini-tts и новые аудио-модели. В карточке — цены, лимиты, приватность и практический выбор.

TOOL

Если вам нужен обычный TTS у OpenAI, сейчас логичнее смотреть на TTS-1 или TTS-1 HD, а не искать несуществующую единую модель «GPT-4o voice».

PRICE

TTS-1 | $15.00 за 1 млн символов | Оптимизирована для скорости; используется через /v1/audio/speech; проверено 13.08.2026 по странице модели.
TTS-1 HD | $30.00 за 1 млн символов | Оптимизирована для качества; используется через /v1/audio/speech; проверено 13.08.2026 по странице модели.
GPT-4o mini TTS | Смотрите текущую страницу модели | Страница модели помечена Deprecated; текущий alias — gpt-4o-mini-tts-2025-12-15; максимум входа — 2000 токенов; exact price не зафиксирован в предоставленном извлечении.

RU

Официальные источники в пакете не подтверждают статус работы и оплаты из РФ; честный вывод — перед внедрением нужно отдельно проверить сеть, аккаунт и биллинг.

✅ Подходит: разработчикам и командам, которым нужен API-синтез речи из текста в экосистеме OpenAI, с выбором между скоростью и качеством, а также тем, кто хочет остаться в одном вендоре для TTS и голосовых интерфейсов.

❌ Не подходит: тем, кто ищет готовое пользовательское приложение вместо API, хочет опираться именно на модель с названием «GPT-4o voice», либо не готов учитывать статус Deprecated у gpt-4o-mini-tts.

💡 Ключевое преимущество: у OpenAI есть отдельный Speech API POST /v1/audio/speech, встроенные голоса, режим кастомного голоса по согласию и соседние voice-модели для realtime-агентов — но это не одна модель, а несколько разных путей.

Если вы пришли по запросу OpenAI TTS (GPT-4o voice), главное уточнение такое: в текущем публичном каталоге OpenAI нет одной активной модели буквально с таким названием. Для чистого text-to-speech через /v1/audio/speech сейчас подтверждены tts-1 и tts-1-hd; gpt-4o-mini-tts endpoint всё ещё принимает, но страница модели уже помечает его как Deprecated.

  • Разработчик: OpenAI
  • Тип: API
  • Официальный URL: OpenAI Audio API Reference
  • Дата проверки: 13.08.2026

Редакционный вердикт: если вам нужен именно пакетный синтез речи из текста, практичнее стартовать с tts-1 или tts-1-hd, потому что они не помечены Deprecated. Если нужен голосовой агент с аудио на входе и выходе, смотреть стоит уже на GPT-Realtime-1.5 или gpt-audio-1.5. Это интерпретация по текущему каталогу моделей, а не прямая формулировка OpenAI.

Что умеет

  • Генерировать речь через отдельный Speech API: POST https://api.openai.com/v1/audio/speech.
  • Возвращать результат как аудиофайл или поток аудиособытий; в официальном примере синтез проверяется записью результата в speech.mp3.
  • Принимать для Speech API модели tts-1, tts-1-hd, gpt-4o-mini-tts и снапшот gpt-4o-mini-tts-2025-12-15.
  • Использовать встроенные голоса: alloy, ash, ballad, coral, echo, fable, onyx, nova, sage, shimmer, verse, marin и cedar.
  • Поддерживать кастомный голос: для создания нужен аудиосэмпл и заранее загруженная запись согласия; доступно только eligible customers.
  • В случае gpt-4o-mini-tts — управлять тем, как модель говорит: OpenAI отдельно представляла эту модель как TTS с задаваемой манерой речи, но сейчас она уже помечена Deprecated.

Как использовать

  1. Определите сценарий. Если нужен просто text-to-speech, выбирайте между tts-1 и tts-1-hd. Если вам нужен не синтезатор, а голосовой агент с аудио-входом и аудио-выходом, это уже другой класс моделей.
  2. Подготовьте текст и голос. Для базового сценария достаточно текста и одного из встроенных голосов. Если вы только настраиваете доступ к API, пригодится наш гайд как подключить OpenAI API и отправить первый запрос.
  3. Отправьте запрос в Speech API. Используйте endpoint /v1/audio/speech из вашего приложения или через официальный SDK. В источниках подтверждены официальные библиотеки для Python и JavaScript/TypeScript.
  4. Сохраните результат. Документация прямо показывает сценарий, где ответ записывается в speech.mp3; также endpoint может возвращать поток аудиособытий.
  5. Если нужен кастомный голос, готовьте комплаенс заранее. OpenAI требует аудиосэмпл и предварительно загруженную запись согласия, а сама возможность ограничена eligible customers.

Практический workflow здесь простой: текст → выбор модели → выбор голоса → запрос в /v1/audio/speech → сохранение файла или обработка стрима. Это хороший вариант для озвучки уведомлений, автоответов, voice-over в продукте и других API-сценариев без отдельного GUI.

Тарифы и ограничения

У OpenAI TTS нет «тарифов» в смысле готовых пользовательских планов внутри этого инструмента; в публичных источниках подтверждена помодельная оплата API-использования. Ниже — то, что можно зафиксировать по предоставленному пакету.

Модель Цена Лимиты и примечания
TTS-1 $15.00 за 1 млн символов Оптимизирована для скорости; работает через Speech API.
TTS-1 HD $30.00 за 1 млн символов Оптимизирована для качества; работает через Speech API.
GPT-4o mini TTS Смотрите текущую страницу модели Страница модели помечена Deprecated; текущий alias — gpt-4o-mini-tts-2025-12-15; максимум входа — 2000 токенов.

Дата проверки: 13.08.2026.

Что важно не перепутать: GPT-Realtime-1.5 и gpt-audio-1.5 — это уже не «чистый TTS» в той же форме, а соседние voice-модели для других сценариев. В текущем каталоге они описаны как лучшие модели для audio in/audio out, но не как прямые замены Speech API один к одному.

Ограничение источников: в пакете нет отдельной сводной pricing page OpenAI с дублирующим подтверждением всех цен, а для gpt-4o-mini-tts в выписке не дано точное числовое значение цены. Поэтому перед закупкой или публикацией коммерческого расчёта перепроверьте live-страницы моделей.

Лимиты скорости и актуальные снапшоты OpenAI меняет часто. В предоставленном пакете есть указание, что страницы моделей содержат rate limits, но конкретные числа в выписке не зафиксированы, поэтому здесь их лучше не пересказывать без живой перепроверки.

Работа с данными и приватность

Для базового синтеза речи сервис получает тот текст, который вы отправляете в /v1/audio/speech. Если вы используете кастомный голос, OpenAI дополнительно получает аудиосэмпл и ранее загруженную запись согласия.

  • Что видит сервис: текст запроса; при кастомном голосе — аудиосэмпл и consent recording.
  • Использование для обучения: в предоставленном пакете это явно не раскрыто, поэтому честный статус — не подтверждено по этим источникам.
  • Где и как применяются региональные ограничения: страница Data controls прямо включает /v1/audio/speech в поддерживаемые аудио-endpoint’ы и указывает, что использование вне США требует дополнительного approval и контролей, связанных с Zero Data Retention.
  • Где хранятся данные: точный регион хранения по этой выписке не фиксируется; для non-US сценариев нужны дополнительные согласования.

Если у вас высокие требования к комплаенсу, privacy review или AI Safety, не ограничивайтесь одной документацией Speech API. Для корпоративного сценария полезно отдельно сравнить Azure OpenAI и OpenAI напрямую, потому что вопросы доступа к моделям и контролей данных там влияют на архитектурное решение.

Практический вывод: OpenAI даёт официальный путь для consent-based custom voice, что лучше, чем «серое» клонирование без согласия. Но если вам нужна жёсткая ясность по региону хранения, тренировочным политикам и биллингу для конкретной юрисдикции, одних источников из этого пакета недостаточно.

Плюсы и минусы

Плюсы

  • Есть отдельный официальный Speech API endpoint, а не только экспериментальные голосовые режимы внутри чата.
  • Понятное разделение по задачам: tts-1 для скорости, tts-1-hd для качества.
  • Список встроенных голосов достаточно широкий уже «из коробки», без обязательного обучения своей voice-модели.
  • Поддержан кастомный голос через explicit consent workflow, а не безусловное клонирование.
  • Есть официальные SDK для Python и JavaScript/TypeScript, что упрощает интеграцию.

Минусы

  • Название «GPT-4o voice» вводит в заблуждение: одной текущей модели с таким буквальным именем в каталоге нет.
  • gpt-4o-mini-tts всё ещё принимается endpoint’ом, но уже помечена как Deprecated, что делает её слабой ставкой для нового продакшена.
  • У gpt-4o-mini-tts зафиксирован максимум входа 2000 токенов.
  • Для регионального использования вне США нужны дополнительные approval и Zero Data Retention-related controls.
  • Статус оплаты, сетевой доступности и практической работы из РФ в предоставленных источниках прямо не подтверждён.

Доступность и язык

  • Платформы: API; в источниках подтверждены официальные SDK для Python и JavaScript/TypeScript.
  • Русский язык интерфейса: в предоставленном пакете нет подтверждения отдельного русскоязычного интерфейса TTS-продукта; речь идёт о документации и API-эндпоинтах OpenAI.
  • Русский язык озвучки: в пакете нет официального списка поддерживаемых языков или качества по русскому, поэтому обещать результат без собственного теста нельзя.
  • Доступность для РФ: официально по этому пакету не подтверждена ни работа без VPN, ни статус оплаты. Честный вывод: перепроверьте доступ к аккаунту, биллинг и сеть перед внедрением.
  • Способы оплаты: в предоставленных источниках не раскрыты.

Альтернативы

  • TTS-1 — базовый выбор внутри OpenAI, если для вас важнее скорость и цена, чем максимальное качество.
  • TTS-1 HD — вариант внутри OpenAI, если вы готовы платить больше ради качества синтеза.
  • GPT-Realtime-1.5 — не чистый TTS, а модель для realtime audio in/audio out, если вы строите голосового агента.
  • gpt-audio-1.5 — не прямой аналог Speech API, а путь для audio in/audio out через Chat Completions.
  • Если вы сравниваете OpenAI со специализированным TTS-вендором, посмотрите наш материал ElevenLabs vs OpenAI TTS.

Если вам нужен не только синтез речи, а выбор API-вендора шире, может пригодиться и сравнение OpenAI API vs Anthropic API. Но для узкой TTS-задачи полезнее сначала решить, нужен ли вам именно pure TTS, realtime voice agent или audio in/audio out в Chat Completions.

Источники

Вопросы и ответы

Есть ли сейчас модель OpenAI с буквальным названием GPT-4o voice?

Нет. По текущему каталогу voice-возможности разделены между TTS-моделями, realtime-моделью и audio-моделью для Chat Completions. Для pure TTS через Speech API подтверждены tts-1 и tts-1-hd; gpt-4o-mini-tts ещё принимается, но уже помечена Deprecated.

Что выбрать для обычной озвучки текста?

Практически — tts-1, если важнее скорость и цена, и tts-1-hd, если важнее качество. Это редакционный вывод по текущим страницам моделей и статусу Deprecated у gpt-4o-mini-tts.

Можно ли всё ещё использовать gpt-4o-mini-tts?

Да, Speech API всё ещё принимает эту модель и её текущий alias, но страница модели помечена Deprecated. Кроме того, в источниках зафиксирован максимум 2000 входных токенов.

Можно ли создать свой голос?

Да, но только по официальному consent-based workflow: нужен аудиосэмпл и ранее загруженная запись согласия. Документация также говорит, что кастомные голоса доступны только eligible customers.

Что известно про приватность, регионы и РФ?

Data controls page включает /v1/audio/speech в поддерживаемые audio-endpoint’ы и указывает дополнительные условия для non-US использования. Но в предоставленном пакете нет полной ясности по тренировочным политикам, региону хранения, оплате и доступности из РФ, поэтому эти пункты нужно перепроверять отдельно перед продакшеном.

Плюсы

  • Есть отдельный официальный Speech API endpoint /v1/audio/speech с возвратом файла или аудиострима.
  • Понятное разделение ролей: TTS-1 для скорости, TTS-1 HD для качества.
  • Доступен набор встроенных голосов без обязательного обучения собственного голоса.
  • Поддержан consent-based workflow для кастомного голоса у eligible customers.
  • Есть официальные SDK для Python и JavaScript/TypeScript.

Минусы

  • «GPT-4o voice» не является одной текущей активной моделью OpenAI, что сбивает с выбором.
  • gpt-4o-mini-tts уже помечена Deprecated, хотя endpoint её ещё принимает.
  • У gpt-4o-mini-tts максимум 2000 входных токенов.
  • Для регионального использования вне США нужны дополнительный approval и Zero Data Retention-related controls.
  • Статус оплаты и доступности из РФ прямо не подтверждён в предоставленном пакете источников.

Источники

SOURCES

Вопросы и ответы

FAQ
Есть ли сейчас модель OpenAI с буквальным названием GPT-4o voice?

Нет. По текущему каталогу voice-возможности разделены между TTS-моделями, realtime-моделью и audio-моделью для Chat Completions. Для pure TTS через Speech API подтверждены tts-1 и tts-1-hd; gpt-4o-mini-tts ещё принимается, но уже помечена Deprecated.

Что выбрать для обычной озвучки текста?

Практически — tts-1, если важнее скорость и цена, и tts-1-hd, если важнее качество. Это редакционный вывод по текущим страницам моделей и статусу Deprecated у gpt-4o-mini-tts.

Можно ли всё ещё использовать gpt-4o-mini-tts?

Да, Speech API всё ещё принимает эту модель и её текущий alias, но страница модели помечена Deprecated. В источниках также зафиксирован максимум 2000 входных токенов.

Можно ли создать свой голос?

Да, но только по official consent-based workflow: нужен аудиосэмпл и ранее загруженная запись согласия. Документация также говорит, что кастомные голоса доступны только eligible customers.

Что известно про приватность, регионы и РФ?

Data controls page включает /v1/audio/speech в поддерживаемые audio-endpoint'ы и указывает дополнительные условия для non-US использования. Но в предоставленном пакете нет полной ясности по тренировочным политикам, региону хранения, оплате и доступности из РФ, поэтому эти пункты нужно перепроверять отдельно.

Читайте также

LINKS