Если вам нужен короткий список AI для субтитров и транскриптов на дату проверки 2026-08-15, ориентиры такие: OpenAI GPT-4o Transcribe — для API-сценариев с таймкодами и дальнейшей сборкой субтитров; OpenAI Whisper — для локальной или офлайн-обработки с прямым экспортом в srt и vtt; Amazon Transcribe — если вы уже работаете в AWS и хотите сценарии с субтитрами и automatic language identification. Для real-time отдельно смотрите Deepgram, а для корпоративных контуров в Google Cloud и Azure — их нативные сервисы ниже.
Для API-сценариев с таймкодами: OpenAI GPT-4o Transcribe — у OpenAI задокументированы word/segment timestamps, а для отдельных workflow есть модель с диаризацией.
Для локального контура: OpenAI Whisper — MIT-репозиторий, CLI и экспорт в txt, vtt, srt, tsv, json.
Для облачного стека с субтитрами: Amazon Transcribe — в официальном FAQ прямо упомянуты субтитры для аудио и видео, а тарификация идёт по секундам с минимумом 15 секунд за запрос.
Редакционное ограничение: этот список собран только по текущему source pack и поэтому заметно смещён в сторону API, cloud STT и self-hosted-инструментов. Если вам нужен потребительский редактор субтитров с монтажным интерфейсом, совместным комментированием и шаблонами экспорта, эта подборка отвечает на задачу лишь частично.
Как отбирали
- Задача: выбрать инструменты для распознавания речи, транскриптов и subtitle-workflow.
- Аудитория: разработчики, автоматизаторы, контент-команды и специалисты, которым нужен не общий каталог, а короткий рабочий список под конкретный стек.
- Дата среза: 2026-08-15.
- Критерии допуска: официальный первичный источник, актуальная документация или репозиторий, явная поддержка speech-to-text / subtitles / transcript workflow, публичная доступность сервиса или кода.
- Критерии исключения: продукты без перепроверки по официальным источникам в текущем пакете; решения, для которых в исходных материалах не подтверждены актуальные условия, цены или ограничения.
- Способ проверки: сверили официальные docs, pricing, quotas, FAQs, release notes и репозиторий. Собственные WER-бенчмарки и сравнительные тесты качества в эту подборку не входили.
- Партнёрские отношения: в исходном пакете не заявлены; на состав списка они не влияли.
Важно: ниже нет «лучшего вообще». Для транскрипции и субтитров обычно важнее не абстрактная точность, а режим работы — real-time или batch, локальный контур или облако, ограничения по региону и то, нужен ли вам готовый srt/vtt или достаточно таймкодов для своей сборки.
Сводная таблица
| Название | Цена | Ключевая фишка | Ограничение | Лучше всего для | Ссылка |
|---|---|---|---|---|---|
| OpenAI GPT-4o Transcribe | Usage-based audio-token pricing; точную ставку смотрите на официальной странице | API-транскрипция с word/segment timestamps; рядом есть модель с диаризацией | Поведение зависит от модели и endpoint; у diarize-модели нет word timestamps | API-пайплайнов и сборки субтитров из таймкодов | → Официальная страница |
| OpenAI Whisper | Без vendor API fee по лицензии MIT, но вычисления и инфраструктура ваши | Self-hosted / offline и прямой экспорт в txt, vtt, srt, tsv, json | Качество, скорость и стоимость зависят от вашего железа и развёртывания | Локального контура и офлайн-обработки | → Репозиторий |
| Google Cloud Speech-to-Text V2 | От $0.003/мин для Dynamic Batch Recognition; остальное зависит от режима, региона и объёма | Minute-based billing, batch-сценарии и экосистема Google Cloud | Квоты и language features зависят от региона и модели | Корпоративной пакетной обработки в GCP | → Официальная страница |
| Azure AI Speech | Pay-as-you-go; есть free tier, но цену нужно проверять по SKU и региону | Real-time, fast transcription и batch transcription в Azure | Batch-режим асинхронный; доступность зависит от региона | Azure-native и compliance-чувствительных сценариев | → Официальная страница |
| Amazon Transcribe | Помесячно по секундам; минимум 15 секунд за запрос; 60 минут в месяц free tier на 12 месяцев | Поддержка subtitle-workflow и automatic language identification | Минимальная биллинговая длительность 15 секунд; доступность зависит от региона | AWS-пайплайнов и автоматических субтитров | → Официальная страница |
| Deepgram | Usage-based; проверяйте текущие планы и региональные условия | Prererecorded + real-time streams, удобен для low-latency-потоков | Rate limits зависят от региона; обновления моделей отслеживаются через changelog | Real-time и разговорной речи | → Официальная страница |
| AssemblyAI | Usage-based; есть free tier, но детали нужно перепроверять на pricing page | Отдельные U.S./EU endpoints и удобный API-first workflow | LLM Gateway не поддерживается в EU; translation — только в U.S. | Разработческих пайплайнов с региональной маршрутизацией | → Официальная страница |
OpenAI GPT-4o Transcribe
Кому подходит: если вы собираете субтитры или транскрипты через API и вам нужны таймкоды, дальнейшая постобработка и связка с другими сервисами OpenAI.
Сильная сторона: OpenAI документирует отдельную линейку моделей для транскрипции и указывает, что gpt-4o-transcribe позиционируется как развитие относительно Whisper. В audio API перечислены текущие варианты моделей, поддержка word и segment timestamps, а также отдельная diarize-модель для сценариев, где нужно разделение по спикерам.
Ограничение: это не «одна кнопка для всего». По исходному пакету нужно учитывать model-specific и endpoint-specific поведение: diarized output не даёт word timestamps, а whisper-1 в API не поддерживает streaming. Перед внедрением обязательно перепроверьте актуальную документацию именно под нужный endpoint.
Цена: usage-based audio-token pricing указана на официальной странице модели, но точные ставки и доступность лучше перепроверять непосредственно перед запуском.
Ссылка: → Официальная страница
OpenAI Whisper
Кому подходит: тем, кому нужен свой контур, офлайн-обработка или предсказуемый self-hosted workflow без зависимости от облачного API-вендора.
Сильная сторона: репозиторий Whisper открыт по лицензии MIT, README описывает CLI-использование и экспорт в txt, vtt, srt, tsv и json. Для задач субтитрования это важный плюс: из коробки есть именно те форматы, которые чаще всего нужны редакторам и автоматизациям. В supplied source pack также зафиксирован релиз v20250625, опубликованный 2025-06-26.
Ограничение: вместе со свободой вы получаете и операционные расходы. Качество, задержка, throughput и итоговая себестоимость зависят уже не от тарифной страницы вендора, а от вашего железа, очередей и способа развёртывания.
Цена: у репозитория нет vendor API fee, но compute, storage и поддержка инфраструктуры — на вашей стороне.
Ссылка: → Репозиторий
Google Cloud Speech-to-Text V2
Кому подходит: командам, которые уже живут в Google Cloud и хотят пакетную обработку, корпоративный billing и большой облачный стек рядом.
Сильная сторона: на официальной pricing page тарификация идёт по минутам, а для Dynamic Batch Recognition указан тариф $0.003 за минуту. Для массовой пакетной обработки это удобная отправная точка, особенно если вы уже храните медиа в инфраструктуре Google Cloud.
Ограничение: у Google важно читать не только прайс, но и quotas plus feature matrix. Документация по квотам, обновлённая 2026-07-22 UTC, указывает, в частности, 300 concurrent streaming sessions per 5 minutes и 3,000 requests per minute; language features и preview-режимы могут различаться по регионам и моделям.
Цена: от $0.003/мин для Dynamic Batch Recognition; остальные режимы и уровни тарификации зависят от объёма, региона и выбранного типа распознавания.
Ссылка: → Официальная страница
Azure AI Speech
Кому подходит: тем, кому нужен Microsoft/Azure-native вариант с реальными региональными оговорками по обработке данных и несколькими режимами транскрипции.
Сильная сторона: в документации Azure отдельно описаны real-time speech-to-text, fast transcription и batch transcription. Для команд с требованиями к размещению данных особенно важна официальная формулировка: speech data обрабатываются в пределах региона ресурса.
Ограничение: batch transcription у Azure асинхронный и доступен через Speech-to-text REST API и Speech CLI. Плюс практическая доступность функций остаётся привязанной к региону и SKU, поэтому «есть в документации» не всегда означает «доступно у вас прямо сейчас».
Цена: pricing page указывает pay-as-you-go и free-tier caveats, но точную стоимость нужно смотреть по региону, SKU и вашему типу использования.
Ссылка: → Официальная страница
Amazon Transcribe
Кому подходит: если ваш медиа- и data-pipeline уже строится в AWS и вы хотите распознавание речи без выхода из экосистемы Amazon.
Сильная сторона: на официальной стороне Amazon удобна комбинация двух вещей: usage-based billing по секундам и явное упоминание subtitle-сценариев в FAQ. Там же отдельно сказано про automatic language identification, что важно для многоязычных входящих файлов.
Ограничение: у биллинга есть практический нюанс — минимальная оплачиваемая длительность составляет 15 секунд на запрос. Для очень коротких фрагментов это влияет на себестоимость. Плюс availability зависит от региона, поэтому архитектуру лучше сверять до запуска.
Цена: per-second billing, minimum 15 seconds per request; на публичной pricing page также указан free tier 60 minutes per month for 12 months.
Ссылка: → Официальная страница
Deepgram
Кому подходит: тем, кто строит real-time-продукты, звонки, ботов или разговорные интерфейсы, где критична низкая задержка и потоковая обработка.
Сильная сторона: Deepgram в getting-started docs явно поддерживает и prerecorded files, и real-time streams. Для mixed-workflow это удобно: один и тот же стек можно использовать и для уже записанных файлов, и для потоков.
Ограничение: limits не универсальны: документация отдельно предупреждает, что rate limits зависят от региона. Плюс изменения моделей нужно отслеживать по changelog. В supplied source pack отдельно отмечено обновление Nova-3 от 2026-03-05 с улучшениями для right-to-left languages и multilingual accuracy, но это означает, что поведение линейки действительно эволюционирует и его нужно перепроверять по датам.
Цена: в этой подборке точные ставки не фиксировались; проверяйте текущие планы и региональные условия на официальной pricing page Deepgram.
Ссылка: → Официальная страница
AssemblyAI
Кому подходит: разработчикам, которым нужен API-first workflow, отдельные endpoints по регионам и дальнейшая обработка транскриптов в приложении.
Сильная сторона: в API reference у AssemblyAI задокументированы отдельные U.S. и EU endpoints. Это полезно, когда вам нужно заранее понимать, куда идёт трафик и как строить региональную маршрутизацию.
Ограничение: региональная история здесь не полностью симметрична. По официальной документации LLM Gateway сейчас не поддерживается в EU, а translation доступен только для specific models и только в U.S. Если вам нужен именно единый европейский контур со всеми надстройками, это надо учитывать заранее.
Цена: usage-based pricing и free tier есть, но детали меняются и должны проверяться на текущей pricing page перед покупкой.
Ссылка: → Официальная страница
Как выбрать: по бюджету, контуру и режиму работы
По бюджету
Если вы хотите минимизировать vendor bill: первым смотрите на OpenAI Whisper. У кода лицензия MIT, но это не значит «бесплатно вообще»: вы сами оплачиваете compute и поддерживаете инфраструктуру. Если у вас уже есть свободные мощности, это может быть выгодно; если их нет, локальный стек быстро перестаёт быть условно дешёвым.
Если нужен понятный облачный старт для batch: у Google Cloud в исходном пакете есть конкретный ориентир — $0.003/мин для Dynamic Batch Recognition. Это один из немногих ценовых фактов, которые здесь можно честно сравнивать без догадок.
Если нужен публичный free tier для проверки гипотезы: Amazon Transcribe даёт 60 минут в месяц на 12 месяцев по публичной pricing page. Для короткого пилота этого может хватить, но добавочные режимы и региональные ставки всё равно нужно перепроверять.
Честная оговорка по цене: полного рейтинга «самый дешёвый» в этой статье нет, потому что у части поставщиков цены завязаны на регион, тип модели, режим или динамические pricing widgets. Если бюджет критичен, делайте короткий proof-of-cost именно на своём формате файлов и длительностях.
По контуру и данным
Нужен офлайн или self-hosted: берите Whisper. Это самый прозрачный вариант в этой подборке для собственного контура и прямого экспорта субтитров.
Нужна явная привязка обработки к региону ресурса: Azure AI Speech здесь выглядит особенно уместно, потому что в документации прямо сказано, что speech data обрабатываются в пределах региона ресурса.
Нужны отдельные U.S./EU endpoints: смотрите AssemblyAI. Но помните, что не все надстройки симметрично доступны в EU.
Если основной сценарий — русский язык: не ориентируйтесь только на слово multilingual в маркетинге. Сверяйте language matrix, регион и поведение моделей на своих данных, а для общей картины посмотрите нашу подборку нейросетей для русского языка.
По режиму работы
Для real-time: в supplied source pack прямо подтверждены real-time streams у Deepgram и real-time speech-to-text у Azure. У Google streaming ограничен квотами, а у OpenAI нужно отдельно проверять текущий endpoint и модель. Если вы строите потоковый сценарий, сначала проверяйте именно лимиты и региональные условия, а уже потом цену.
Для пакетной транскрипции: сильные кандидаты — Google Cloud Speech-to-Text V2 с Dynamic Batch Recognition и Azure batch transcription, который работает асинхронно. Deepgram тоже поддерживает prerecorded files, что удобно для mixed-flow.
Если нужен прямой экспорт subtitle-файлов: самый явный кандидат в этой подборке — Whisper, потому что в README прямо перечислены vtt и srt. У Amazon Transcribe официальный FAQ подтверждает subtitle-сценарии. Для API-вариантов с таймкодами вроде OpenAI вы часто будете собирать итоговый subtitle-format уже в своём пайплайне.
Если после транскрипции вы превращаете разговоры в статьи, заметки или knowledge base, полезно сразу связать этот выбор с соседними задачами: AI для написания текстов и AI для работы с PDF и документами. А если расшифровки идут в нарезки, шорты и соцсети, посмотрите и подборку AI для SMM и контента.
Кого не включили и почему
- Otter: не вошёл не потому, что обязательно слабее, а потому что в текущем source pack он не был перепроверен по официальным первичным источникам.
- Sonix: не включён по той же причине — в этом материале не верифицировались его актуальные цены, ограничения и региональные условия.
- Notta: в supplied source pack нет достаточного набора официальных подтверждений для честного сравнения с участниками списка.
- Rev: не вошёл, потому что эта подборка не претендует на полный обзор рынка и ограничена инструментами, которые были перепроверены в текущем пакете источников.
Это не означает, что перечисленные сервисы вам не подойдут. Это означает только одно: редакционно мы не стали включать их без новой сверки по официальным источникам.
Как выбрать самостоятельно
- Нужен ли вам именно готовый
srt/vtt, или достаточно таймкодов для собственной сборки? - Где должны обрабатываться данные: в вашем контуре, в конкретном облачном регионе или это не критично?
- Какой режим у вас основной: real-time поток, batch-пакеты или смешанный workflow?
- Нужны ли word timestamps, diarization, language identification или translation?
- Есть ли у вас уже инфраструктурный стек в AWS, Azure, GCP или вы хотите максимально нейтральный API?
Практический вердикт
Если говорить совсем практично, то выбор обычно сводится к четырём маршрутам. Whisper — когда важен свой контур и прямой subtitle-export. OpenAI GPT-4o Transcribe — когда нужен API с таймкодами и дальнейшей постобработкой. Deepgram — когда основной сценарий real-time. Amazon, Google Cloud или Azure — когда уже есть облачный стек и вы хотите не спорить с корпоративной архитектурой.
Главное ограничение этой подборки в том, что она лучше отвечает разработчикам и automation-командам, чем редакторам, ищущим визуальный subtitle-editor. Если вам нужен именно end-user SaaS с интерфейсом для ручной правки, считайте этот материал отправной точкой по движкам распознавания, а не окончательным выбором приложения.
Источники
Дата последней проверки ссылок: 2026-08-15.
- GPT-4o Transcribe – OpenAI API
- Audio – OpenAI API
- Whisper Audio API FAQ
- openai/whisper
- Releases · openai/whisper
- Speech-to-Text pricing
- Speech-to-Text quotas
- Speech-to-Text supported languages and models
- Speech-to-text overview
- Batch transcription – Speech service
- Azure AI Speech regions
- Speech service pricing
- Amazon Transcribe pricing
- Amazon Transcribe FAQs
- Supported languages and language-specific features
- Getting Started with Speech to Text
- API Rate Limits
- Changelog
- API Reference Overview
- Pricing – AssemblyAI
- Translation
Вопросы и ответы
Какой AI выбрать для офлайн-субтитров без облака?
Из этой подборки самый прямой вариант — OpenAI Whisper. Репозиторий открыт по MIT, а README прямо перечисляет экспорт в vtt и srt. Ограничение простое: за железо, скорость и поддержку окружения отвечаете вы.
Что лучше для real-time транскрипции?
Если смотреть только на подтверждённые в source pack факты, самый явный кандидат — Deepgram, потому что у него официально задокументированы и prerecorded files, и real-time streams. У Azure real-time STT тоже есть, а у Google нужно учитывать квоты. Для OpenAI проверяйте конкретный endpoint и модель перед внедрением.
Можно ли одновременно получить диаризацию и word timestamps?
В документации OpenAI указано, что diarized output доступен у gpt-4o-transcribe-diarize, но у такого вывода нет word timestamps. На практике это означает, что идеальную комбинацию нужно продумывать на уровне пайплайна, а не рассчитывать на один универсальный ответ модели.
Какой вариант лучше, если важен регион обработки данных?
В этой подборке особенно выделяются Azure AI Speech и AssemblyAI. Azure прямо говорит о processing within the region of the resource, а AssemblyAI документирует отдельные U.S./EU endpoints. Но у AssemblyAI не все возможности доступны симметрично: например, LLM Gateway не поддерживается в EU, а translation — U.S.-only.
Какой сервис самый дешёвый?
Честного универсального победителя здесь нет. По подтверждённым данным у Google есть ориентир $0.003/мин для Dynamic Batch Recognition, у Amazon — free tier 60 минут в месяц на 12 месяцев и тарификация по секундам, а Whisper убирает vendor fee, но переносит стоимость в ваш compute. Поэтому сравнивать лучше на своих файлах, длительностях и регионе.