Коротко:
- Для встреч с несколькими спикерами: OpenAI GPT-4o Transcribe Diarize — встроенная диаризация, но цена в этом срезе не зафиксирована.
- Для enterprise и видеофайлов: Google Cloud Speech-to-Text v2 — регионализация, data residency, CMEK и отдельный сценарий для видео.
- Для бюджета и простого API: OpenAI Whisper-1 — подтверждённая ставка $0.006 за минуту.
Практический вердикт: если вам нужен production speech-to-text без лишней экзотики, начинайте с Google Cloud Speech-to-Text v2, AWS Transcribe и OpenAI Whisper-1. Если ключевая боль — разделение спикеров, смотрите OpenAI GPT-4o Transcribe Diarize. Если вам важны edge и контейнеры, отдельным кандидатом идёт Azure Speech-to-Text. Часть цен и региональных нюансов в этом срезе удалось зафиксировать не для всех сервисов одинаково глубоко, поэтому Deepgram и Azure я помечаю как проверяемые по официальной странице, а не как окончательно просчитанные.
Если у вас транскрибация встроена в более широкий видеопроцесс, полезно сопоставить этот список с Лучшие ИИ-инструменты для видеомонтажа и Лучшие нейросети для видео из текста: как выбрать сервис под задачу. Если transcript дальше идёт в отчёты и базы знаний, посмотрите ещё Лучшие ИИ для работы с PDF и документами.
Как отбирали
Это подборка для разработчиков, продуктовых команд, медиагрупп и автоматизаторов, которым нужен короткий список production-ориентированных AI-сервисов для транскрибации аудио и видео. Мы брали только официальные страницы и документацию из source pack, без живых тестов и без догадок о ценах там, где прайс не был зафиксирован в срезе.
- Задача: транскрибация аудио и видео для production-сценариев.
- Аудитория: разработчики, product/ops, медиакоманды, автоматизаторы.
- Дата среза: 13 августа 2026.
- Критерии допуска: официальная документация или прайс, текущий API или сервис, понятные ограничения, применимость к аудио и/или видео.
- Критерии исключения: waitlist, consumer-only apps без сопоставимых официальных данных в срезе, решения без проверяемой pricing/docs страницы, не production-ориентированные wrappers.
- Способ проверки: только официальные страницы и документация из source pack; live-тесты не проводились.
- Партнёрские отношения: нет.
Ограничение редакции: там, где source pack не дал точного прайса или региональной вилки, я не подставляю ориентировочную цену. Это особенно важно для OpenAI GPT-4o Transcribe Diarize, Deepgram Nova и Azure Speech-to-Text.
Сводная таблица
| Название | Цена | Ключевая фишка | Недостаток | Ссылка |
|---|---|---|---|---|
| OpenAI GPT-4o Transcribe Diarize | не зафиксирована в этом срезе | встроенная speaker diarization в Transcription API | доступен только в Transcription API; региональные правила для аудио у OpenAI всё ещё действуют | Официальная страница |
| Google Cloud Speech-to-Text v2 | standard recognition $0.016/мин; dynamic batch $0.003/мин; V1 without data logging $0.024/мин после 60 бесплатных минут | регионализация, data residency, CMEK, диаризация, multichannel | цена зависит от версии, модели, каналов и batch-метода; для развёртывания нужно перепроверять регион | Официальная страница |
| AWS Transcribe | 60 минут бесплатно в месяц первые 12 месяцев; batch-пример $0.006/мин; биллинг по секундам без минимума | AWS-native пайплайны для batch и streaming | redaction и custom language model могут добавить стоимость; региональная поддержка варьируется | Официальная страница |
| Deepgram Nova | не зафиксирована в этом срезе | 45+ языков и speaker diarization | точную цену и ограничения по concurrency нужно сверять на прайс-странице перед покупкой | Официальная страница |
| AssemblyAI Universal-3.5 Pro | $0.21/час; Universal-2 — $0.15/час | production STT с заметными speech-understanding возможностями | планы и региональные опции могут меняться; residency и лимиты нужно подтверждать на официальных страницах | Официальная страница |
| Azure Speech-to-Text | не зафиксирована в этом срезе | cloud или edge в контейнерах, CLI, SDK и REST | цены и доступность зависят от региона, tier и sovereign cloud | Официальная документация |
| OpenAI Whisper-1 | $0.006/мин | низкобюджетный baseline с простым API | нужно отдельно проверять limits по размеру файла, streaming и региональной обработке | Официальная страница |
OpenAI GPT-4o Transcribe Diarize
- Кому подходит: встречи, интервью и многоучастниковые записи, где важно разделение спикеров.
- Сильная сторона: встроенная диаризация в Transcription API.
- Ограничение: модель доступна только в Transcription API; для аудио у OpenAI действуют региональные правила, а цену именно для Diarize в этом срезе я не зафиксировал.
- Цена: не зафиксирована в этом срезе; проверьте страницу модели перед закупкой.
- Ссылка: Официальная страница модели
Примечание: в той же OpenAI-линейке есть базовый GPT-4o Transcribe на v1/audio/transcriptions с ценой $2.50 за 1 млн input tokens и $10.00 за 1 млн output tokens. Здесь я не делаю его отдельной позицией, чтобы не смешивать сценарии.
Google Cloud Speech-to-Text v2
- Кому подходит: enterprise batch-транскрибация, региональные развёртывания и видеофайлы.
- Сильная сторона: fully regionalized V2, data residency, CMEK, speaker diarization и multichannel recognition; у Google есть отдельный сценарий для транскрибации аудиодорожки из видео.
- Ограничение: цена меняется в зависимости от версии, модели, каналов и batch-метода, поэтому без проверки региона закупаться рано.
- Цена: V2 standard recognition $0.016/мин; dynamic batch $0.003/мин; V1 without data logging — $0.024/мин после 60 бесплатных минут.
- Ссылка: Официальная страница
AWS Transcribe
- Кому подходит: AWS-native production-пайплайны с batch или streaming transcription.
- Сильная сторона: понятный pay-as-you-go, биллинг по секундам без минимума и free tier на 60 аудиоминут в месяц в первые 12 месяцев.
- Ограничение: automatic content redaction и custom language model могут добавить стоимость; генеративная call summarization тоже имеет отдельный минимум на запрос.
- Цена: free tier 60 минут/мес первые 12 месяцев; в прайс-примере batch transcription стоит $0.006/мин.
- Ссылка: Официальная страница
Deepgram Nova
- Кому подходит: real-time streaming, live captions и feature-rich speech-to-text APIs.
- Сильная сторона: поддержка 45+ языков и speaker diarization.
- Ограничение: точную модельную цену и часть concurrency-ограничений нужно перепроверять на прайс-странице перед покупкой.
- Цена: не зафиксирована в этом срезе.
- Ссылка: Официальная страница
AssemblyAI Universal-3.5 Pro
- Кому подходит: production STT, где важны диаризация и speech-understanding функции, а также понятный поминутный или почасовой ориентир.
- Сильная сторона: в этом срезе у AssemblyAI самый прозрачный hourly pricing среди продуктовых STT-платформ.
- Ограничение: плановые детали и региональные опции могут меняться, поэтому residency и лимиты нужно подтверждать на официальной странице.
- Цена: Universal-3.5 Pro — $0.21/час; Universal-2 — $0.15/час.
- Ссылка: Официальная страница
Azure Speech-to-Text
- Кому подходит: Microsoft-centric стеки, а также сценарии, где нужен запуск в облаке или на edge в контейнерах.
- Сильная сторона: CLI, SDK и REST, плюс явная поддержка cloud и edge deployment в контейнерах.
- Ограничение: цены и доступность зависят от региона, tier и sovereign cloud, поэтому без проверки на своей географии решение не финализируйте.
- Цена: не зафиксирована в этом срезе.
- Ссылка: Официальная документация
OpenAI Whisper-1
- Кому подходит: низкобюджетная базовая транскрибация и простой API-интеграционный сценарий.
- Сильная сторона: подтверждённый ценник $0.006 за минуту и понятный путь через
v1/audio/transcriptions. - Ограничение: перед продом нужно отдельно проверить ограничения по размеру файла, streaming и региональной обработке в OpenAI docs.
- Цена: $0.006/мин.
- Ссылка: Официальная страница модели
Как выбрать: по бюджету / опыту / платформе
По бюджету
- Самый дешёвый подтверждённый baseline: OpenAI Whisper-1 — $0.006/мин.
- Самый низкий подтверждённый batch-rate в этом срезе: Google Cloud Speech-to-Text v2 dynamic batch — $0.003/мин.
- Старт без счёта в первые месяцы: AWS Transcribe даёт 60 минут в месяц первые 12 месяцев.
- Если нужен speaker separation: иногда выгоднее переплатить за OpenAI GPT-4o Transcribe Diarize, чем городить post-processing.
По опыту
- Для начинающих: Whisper-1, потому что у него простой endpoint и прозрачная минутная ставка.
- Для команд с требованиями к резидентности и контролю: Google Cloud Speech-to-Text v2 или Azure Speech-to-Text.
- Для AWS-стека: AWS Transcribe.
- Для real-time voice workflows: Deepgram Nova.
По платформе
- Web/API first: Whisper-1, GPT-4o Transcribe Diarize, AssemblyAI и Deepgram.
- AWS-native: AWS Transcribe.
- Microsoft stack и edge: Azure Speech-to-Text.
- Regional batch и video: Google Cloud Speech-to-Text v2.
Кого не включили и почему
В эту подборку не попали несколько популярных названий не потому, что они заведомо хуже, а потому, что в этом срезе у нас не было сопоставимых официальных данных по текущим ценам, региональности и production-ограничениям. Для подборки это критично: без проверяемой документации сравнение быстро превращается в маркетинг.
- Otter.ai: в source pack не было проверяемой официальной страницы с текущими ценами и production-ограничениями для этого среза.
- Descript: в source pack не было сопоставимого official pricing/docs материала, достаточного для честного сравнения STT-сценария.
- Sonix: не хватило официально верифицируемых данных по нынешним тарифам и региональным условиям.
- Happy Scribe: в срезе не было достаточной официальной информации для сравнения по тем же критериям, что у участников списка.
Как выбрать самостоятельно
- Нужна ли вам диаризация, или достаточно обычной транскрибации?
- Это live-stream, batch-обработка или смешанный сценарий?
- Есть ли у вас требования к data residency, region locking или edge deployment?
- Нужно ли обрабатывать видеофайлы напрямую, или вы готовы извлекать аудио отдельно?
- Что для вас важнее: низкая цена, понятный API, или контроль над инфраструктурой?
Источники
Дата проверки: 13 августа 2026.
- GPT-4o Transcribe Model | OpenAI API
- GPT-4o Transcribe Diarize Model | OpenAI API
- Whisper Model | OpenAI API
- Data controls in the OpenAI platform
- Speech-to-Text API Pricing | Google Cloud
- Speech-to-Text: AI voice typing & transcription | Google Cloud
- Migrate to the latest version of Cloud Speech-to-Text API | Google Cloud Documentation
- Transcribe audio from a video file using Speech-to-Text | Google Cloud Documentation
- Amazon Transcribe Pricing
- Deepgram Pricing | Scalable Speech-to-Text, Text-to-Speech & Voice Agent APIs
- AssemblyAI | Pricing | Production-ready AI Models
- What Is Azure Speech? – Foundry Tools | Microsoft Learn
- Robust Speech Recognition via Large-Scale Weak Supervision
Вопросы и ответы
Какой сервис самый дешёвый из подтверждённых в этом списке?
Если смотреть на зафиксированную цену за минуту, у OpenAI Whisper-1 есть ставка $0.006/мин. Для batch-сценариев у Google Cloud Speech-to-Text v2 в source pack зафиксирован dynamic batch по $0.003/мин.
Что лучше для нескольких спикеров?
В этом срезе самый прямой кандидат — OpenAI GPT-4o Transcribe Diarize, потому что у него встроена speaker diarization и он доступен именно в Transcription API.
Что выбрать для видеофайлов?
Если вам важен именно прямой сценарий с видео, Google Cloud Speech-to-Text v2 здесь самый удобный по документации: у Google есть отдельный tutorial для транскрибации аудиодорожки из видеофайла.
Можно ли взять решение с edge-развёртыванием?
Да. В этом списке Azure Speech-to-Text явно поддерживает cloud или edge в контейнерах, поэтому его стоит смотреть, если запуск вне публичного облака для вас важен.