COMRAD404 / TOOL

Whisper (OpenAI) — транскрибация аудио через API и open-source репозиторий

Whisper (OpenAI) — API и open-source стек для многоязычной транскрибации аудио, перевода речи и определения языка. Ниже — цена whisper-1, форматы ответа, ограничения по данным, версия репозитория и прямые альтернативы.

TOOL

Whisper (OpenAI) подходит для многоязычной батчевой транскрибации аудио и перевода речи, но не для видео-входа и не для сценариев, где без допроверки критичны privacy и региональные data controls.

PRICE

whisper-1 API | $0.006/мин | Цена указана на официальной странице модели на 2026-08-17. Ограничения: аудиовход, текстовый вывод, без поддержки видео. Второй независимый ценовой источник в пакете отсутствует.
openai/whisper (GitHub) | Цена не указана в источниках | Пакет устанавливается через pip install -U openai-whisper, заявлена совместимость с Python 3.8–3.11, требуется ffmpeg. Инфраструктурные затраты зависят от вашей среды.

RU

Официальные источники из пакета не дают отдельного статуса для России. Поэтому нельзя честно утверждать ни работу без VPN, ни блокировку как общий факт. Доступность аккаунта и оплаты для РФ нужно проверять в текущем кабинете OpenAI; для ряда других регионов аудио-эндпоинты требуют MAM или ZDR.

Подходит: если вам нужна многоязычная батчевая транскрибация аудио, перевод речи и определение языка в экосистеме OpenAI или через открытый репозиторий. ❌ Не подходит: если вам нужен видео-вход, гарантированно актуальный realtime-сценарий или полностью закрытый юридический контур без дополнительной проверки data controls. 💡 Ключевое преимущество: один и тот же стек покрывает API-модель whisper-1 и открытый репозиторий openai/whisper.

Разработчик: OpenAI

Тип: API, open-source репозиторий/CLI

Официальный URL: https://developers.openai.com/api/docs/models/whisper-1

Дата проверки: 17.08.2026

Если вы выбираете API для ASR, Whisper остаётся понятным вариантом для пакетной обработки аудио. По официальной странице модели это general-purpose speech recognition для многоязычного распознавания речи, speech translation и language identification. При этом в актуальной документации OpenAI уже описаны и новые альтернативы: GPT-4o Transcribe, GPT-4o mini Transcribe и GPT-Realtime-Whisper.

Что умеет

  • Распознаёт речь на многих языках и возвращает текст.
  • Поддерживает перевод речи в текстовом виде и определение языка.
  • В API работает с аудиовходом и текстовым выходом; видео не поддерживается.
  • Через аудио-референс OpenAI используется в вызове POST /audio/transcriptions.
  • Поддерживает форматы ответа json, text, srt, verbose_json, vtt и diarized_json.
  • Имеет открытый репозиторий openai/whisper; пакет ставится через pip install -U openai-whisper, для работы нужен ffmpeg.

Практически это означает следующее: whisper-1 удобен, когда вам нужно быстро получить текст, субтитры или структурированный JSON из аудио, а не строить мультимодальный пайплайн вокруг видео. Для локального сценария важен и тот факт, что репозиторий живой: на момент проверки в релизах и changelog верхней записью был тег v20250625.

Как использовать

  1. Выберите режим запуска. Если вам нужен облачный маршрут, берите API OpenAI. Если нужен управляемый запуск в своей среде, смотрите репозиторий openai/whisper; там подтверждены установка через pip, совместимость с Python 3.8–3.11 и зависимость от ffmpeg.
  2. Подготовьте аудио и вызовите транскрибацию. В API текущий подтверждённый путь — POST /audio/transcriptions с моделью whisper-1. По сути это обычный шаг inference над аудиофайлом.
  3. Сразу выберите формат результата под задачу. Для простой расшифровки подойдёт text или json, для субтитров — srt или vtt, для более подробного разбора — verbose_json или diarized_json.
  4. Проверьте, нужен ли вам именно Whisper. Если задача близка к realtime или вы уже строите новый пайплайн на свежих моделях OpenAI, сравните Whisper с GPT-4o transcription-линейкой до внедрения.
  5. Не перепутайте локальные модели CLI. В репозитории сказано, что turbo — модель CLI по умолчанию, но она не обучалась для translation tasks. Если вам нужен именно перевод речи, это ограничение нужно учитывать заранее.
POST /audio/transcriptions
model=whisper-1
response_format=srt

Это минимальный воспроизводимый workflow для интервью, звонков, подкастов и черновых субтитров. Но точный набор поддерживаемых входных форматов и нюансы streaming-режимов в этом пакете подтверждены не полностью, поэтому перед интеграцией их нужно перепроверить в текущем audio reference OpenAI.

Тарифы и ограничения

План Цена Лимиты
whisper-1 API $0.006/мин Цена указана на странице модели. Принимает только аудио, возвращает только текст, видео не поддерживается. В предоставленном пакете нет второй отдельной pricing-страницы, поэтому перед оплатой перепроверьте актуальную цену в документации OpenAI.
openai/whisper (GitHub) Цена не указана в источниках Заявлены установка через pip install -U openai-whisper, совместимость с Python 3.8–3.11 и обязательный ffmpeg. Инфраструктурные расходы и лимиты зависят от вашей среды и в источниках не оценены.

Проверено: 17.08.2026.

Отдельно важно, что OpenAI продолжает документировать whisper-1, но рядом уже публикует новые модели для транскрибации и realtime-сценариев. Поэтому Whisper сегодня выглядит скорее как рабочий и понятный baseline внутри OpenAI API, а не как единственный рекомендуемый путь на будущее.

Работа с данными и приватность

В облачном варианте сервис получает ваше аудио и возвращает текстовый результат. По странице модели модальности жёстко ограничены: audio input only и text output only. Если вы отправляете звонки, интервью или внутренние встречи, считайте, что содержимое аудио уходит в OpenAI API, и планируйте доступы соответственно.

В предоставленном пакете подтверждено, что страницы data controls OpenAI распространяются на audio transcription, translation и speech endpoints. Для ЕЭЗ вместе со Швейцарией, а также для Австралии, Канады, Японии, Индии, Сингапура, Южной Кореи, Великобритании и ОАЭ отмечено требование MAM или ZDR.

Что не хватает для полноценной юридической проверки: в этом source pack нет отдельной ссылки на Privacy Policy OpenAI и нет достаточного подтверждения режима использования аудиоданных для обучения именно в вашем сценарии. Поэтому честный вывод такой: для compliance нельзя опираться только на эту карточку; перед запуском проверьте актуальную страницу data controls, настройки организации и юридические документы OpenAI.

Если вы идёте через открытый репозиторий, маршрут хранения и обработки данных определяется уже вашей инфраструктурой, а не только документацией OpenAI. Это может быть практическим плюсом, но сам пакет не содержит готовых гарантий по хранению, региону или срокам ретенции.

Плюсы и минусы

Плюсы

  • Один стек покрывает многоязычное распознавание речи, speech translation и language identification.
  • API поддерживает несколько полезных форматов результата, включая srt, vtt и структурированные JSON-варианты.
  • Есть открытый репозиторий с установкой через pip; это удобно для команд, которым нужен не только облачный вызов.
  • Репозиторий не выглядит заброшенным: на момент проверки верхняя запись в релизах и changelog — v20250625.
  • Исходная статья описывает очень крупный обучающий корпус: 680 000 часов размеченного аудио, включая 117 000 часов по 96 другим языкам и 125 000 часов переводческих данных.

Минусы

  • Whisper не принимает видео: только аудиовход и только текстовый выход.
  • В актуальной документации OpenAI уже есть более новые альтернативы для транскрибации и realtime, поэтому whisper-1 — не обязательно лучший выбор для нового проекта.
  • В локальном CLI модель turbo используется по умолчанию, но не обучалась для translation tasks.
  • В source pack нет второй независимой страницы с ценой и нет отдельной Privacy Policy, так что закупку и юридическое согласование по одной карточке закрыть нельзя.
  • Точный набор поддерживаемых входных форматов и streaming-нюансов нужно перепроверять в текущем audio reference перед внедрением.

Доступность и язык

  • Платформы: API OpenAI; open-source пакет/CLI на Python. Отдельный список поддерживаемых ОС в этом пакете не зафиксирован.
  • Русский язык: модель описана как многоязычная. Отдельный русский интерфейс в официальных источниках из пакета не описан.
  • Доступность для РФ: официальные источники из пакета не дают отдельного статуса для России. Поэтому нельзя честно утверждать ни работу без VPN, ни блокировку как общий факт. Доступность аккаунта и оплаты для РФ нужно проверять в текущем кабинете OpenAI.
  • Региональные caveats: для ЕЭЗ + Швейцарии, Австралии, Канады, Японии, Индии, Сингапура, Южной Кореи, Великобритании и ОАЭ для аудио-эндпоинтов отмечено требование MAM или ZDR.
  • Способы оплаты: в предоставленном пакете не раскрыты.

Альтернативы

  • GPT-4o Transcribe — более новый путь внутри OpenAI для speech-to-text; если вы строите новый API-пайплайн, его стоит сравнить с whisper-1 до внедрения.
  • GPT-4o mini Transcribe — более дешёвая транскрибация внутри линейки OpenAI; в audio reference для некоторых GPT-4o transcription-вариантов отмечены более жёсткие ограничения по форматам ответа, чем у Whisper.
  • GPT-Realtime-Whisper — вариант для низкой задержки и потоковой речи, а не для классической пакетной расшифровки.
  • Whisper vs AssemblyAI для транскрибации: что выбрать — если сравниваете OpenAI с отдельным ASR-провайдером, этот материал удобнее, чем читать спецификации по отдельности.
  • Whisper vs Deepgram: что выбрать для распознавания речи — полезно, если вам важны не только цена и форматы, но и общий профиль провайдера.

Практический вердикт

Если вам нужна недорогая и понятная пакетная транскрибация аудио в OpenAI, whisper-1 всё ещё имеет смысл: цена на странице модели указана поминутно, форматы вывода удобные, а у проекта есть открытый репозиторий. Если же вы начинаете интеграцию с нуля и вам важны realtime-сценарии или более свежая линейка моделей OpenAI, сначала сравните Whisper с GPT-4o transcription-моделями.

Редакционное ограничение: в этом пакете нет отдельной Privacy Policy и второй независимой ценовой страницы для whisper-1, поэтому карточка годится для короткого отбора инструмента, но не заменяет финальную юридическую и закупочную проверку.

Источники

Вопросы и ответы

Можно ли транскрибировать видео через Whisper?

Нет. По официальной странице модели Whisper принимает только аудио и возвращает только текст. Видео как вход не поддерживается.

Whisper умеет переводить речь?

Да, официальная страница модели относит Whisper к general-purpose speech recognition для multilingual speech recognition, speech translation и language identification. Но в open-source CLI модель turbo по умолчанию не обучалась для translation tasks.

Сколько стоит whisper-1?

На странице модели указано $0.006/мин за transcription. Важно ограничение: в предоставленном пакете нет второй отдельной pricing-страницы, поэтому перед оплатой перепроверьте цену в текущей документации OpenAI.

Какие форматы ответа поддерживаются?

В audio reference перечислены json, text, srt, verbose_json, vtt и diarized_json. Для некоторых GPT-4o transcription-вариантов ограничения по форматам строже, чем у Whisper.

Можно ли использовать Whisper без облака OpenAI?

В пакете подтверждён открытый репозиторий openai/whisper. Для него указаны установка через pip, совместимость с Python 3.8–3.11 и зависимость от ffmpeg. Но условия хранения данных и инфраструктурные расходы в таком сценарии определяете уже вы.

Плюсы

  • Один стек покрывает многоязычное распознавание речи, speech translation и language identification.
  • API поддерживает несколько форматов результата, включая srt, vtt и структурированные JSON-варианты.
  • Есть открытый репозиторий openai/whisper с установкой через pip.
  • Репозиторий не выглядит заброшенным: в релизах и changelog на момент проверки верхняя запись — v20250625.

Минусы

  • Whisper принимает только аудио и возвращает только текст; видео не поддерживается.
  • В актуальной документации OpenAI уже есть более новые альтернативы для транскрибации и realtime-сценариев.
  • В локальном CLI модель turbo по умолчанию не обучалась для translation tasks.
  • В source pack нет отдельной Privacy Policy и второй независимой ценовой страницы для whisper-1, поэтому перед внедрением нужна дополнительная проверка.

Источники

SOURCES

Вопросы и ответы

FAQ
Можно ли транскрибировать видео через Whisper?

Нет. По официальной странице модели Whisper принимает только аудио и возвращает только текст. Видео как вход не поддерживается.

Whisper умеет переводить речь?

Да. Официальная страница модели относит Whisper к general-purpose speech recognition для multilingual speech recognition, speech translation и language identification. Но в open-source CLI модель turbo по умолчанию не обучалась для translation tasks.

Сколько стоит whisper-1?

На странице модели указано $0.006/мин за transcription. В предоставленном пакете нет второй отдельной pricing-страницы, поэтому перед оплатой цену стоит перепроверить в текущей документации OpenAI.

Какие форматы ответа поддерживаются?

В audio reference перечислены json, text, srt, verbose_json, vtt и diarized_json. Для некоторых GPT-4o transcription-вариантов ограничения по форматам строже, чем у Whisper.

Можно ли использовать Whisper без облака OpenAI?

Да, в пакете подтверждён открытый репозиторий openai/whisper. Для него указаны установка через pip, совместимость с Python 3.8–3.11 и зависимость от ffmpeg. Но условия хранения данных и инфраструктурные расходы в таком сценарии определяете вы.

Читайте также

LINKS