✅ Подходит: если вам нужна многоязычная батчевая транскрибация аудио, перевод речи и определение языка в экосистеме OpenAI или через открытый репозиторий. ❌ Не подходит: если вам нужен видео-вход, гарантированно актуальный realtime-сценарий или полностью закрытый юридический контур без дополнительной проверки data controls. 💡 Ключевое преимущество: один и тот же стек покрывает API-модель whisper-1 и открытый репозиторий openai/whisper.
Разработчик: OpenAI
Тип: API, open-source репозиторий/CLI
Официальный URL: https://developers.openai.com/api/docs/models/whisper-1
Дата проверки: 17.08.2026
Если вы выбираете API для ASR, Whisper остаётся понятным вариантом для пакетной обработки аудио. По официальной странице модели это general-purpose speech recognition для многоязычного распознавания речи, speech translation и language identification. При этом в актуальной документации OpenAI уже описаны и новые альтернативы: GPT-4o Transcribe, GPT-4o mini Transcribe и GPT-Realtime-Whisper.
Что умеет
- Распознаёт речь на многих языках и возвращает текст.
- Поддерживает перевод речи в текстовом виде и определение языка.
- В API работает с аудиовходом и текстовым выходом; видео не поддерживается.
- Через аудио-референс OpenAI используется в вызове
POST /audio/transcriptions. - Поддерживает форматы ответа
json,text,srt,verbose_json,vttиdiarized_json. - Имеет открытый репозиторий
openai/whisper; пакет ставится черезpip install -U openai-whisper, для работы нуженffmpeg.
Практически это означает следующее: whisper-1 удобен, когда вам нужно быстро получить текст, субтитры или структурированный JSON из аудио, а не строить мультимодальный пайплайн вокруг видео. Для локального сценария важен и тот факт, что репозиторий живой: на момент проверки в релизах и changelog верхней записью был тег v20250625.
Как использовать
- Выберите режим запуска. Если вам нужен облачный маршрут, берите API OpenAI. Если нужен управляемый запуск в своей среде, смотрите репозиторий
openai/whisper; там подтверждены установка через pip, совместимость с Python 3.8–3.11 и зависимость отffmpeg. - Подготовьте аудио и вызовите транскрибацию. В API текущий подтверждённый путь —
POST /audio/transcriptionsс модельюwhisper-1. По сути это обычный шаг inference над аудиофайлом. - Сразу выберите формат результата под задачу. Для простой расшифровки подойдёт
textилиjson, для субтитров —srtилиvtt, для более подробного разбора —verbose_jsonилиdiarized_json. - Проверьте, нужен ли вам именно Whisper. Если задача близка к realtime или вы уже строите новый пайплайн на свежих моделях OpenAI, сравните Whisper с GPT-4o transcription-линейкой до внедрения.
- Не перепутайте локальные модели CLI. В репозитории сказано, что
turbo— модель CLI по умолчанию, но она не обучалась для translation tasks. Если вам нужен именно перевод речи, это ограничение нужно учитывать заранее.
POST /audio/transcriptions model=whisper-1 response_format=srt
Это минимальный воспроизводимый workflow для интервью, звонков, подкастов и черновых субтитров. Но точный набор поддерживаемых входных форматов и нюансы streaming-режимов в этом пакете подтверждены не полностью, поэтому перед интеграцией их нужно перепроверить в текущем audio reference OpenAI.
Тарифы и ограничения
| План | Цена | Лимиты |
|---|---|---|
| whisper-1 API | $0.006/мин | Цена указана на странице модели. Принимает только аудио, возвращает только текст, видео не поддерживается. В предоставленном пакете нет второй отдельной pricing-страницы, поэтому перед оплатой перепроверьте актуальную цену в документации OpenAI. |
| openai/whisper (GitHub) | Цена не указана в источниках | Заявлены установка через pip install -U openai-whisper, совместимость с Python 3.8–3.11 и обязательный ffmpeg. Инфраструктурные расходы и лимиты зависят от вашей среды и в источниках не оценены. |
Проверено: 17.08.2026.
Отдельно важно, что OpenAI продолжает документировать whisper-1, но рядом уже публикует новые модели для транскрибации и realtime-сценариев. Поэтому Whisper сегодня выглядит скорее как рабочий и понятный baseline внутри OpenAI API, а не как единственный рекомендуемый путь на будущее.
Работа с данными и приватность
В облачном варианте сервис получает ваше аудио и возвращает текстовый результат. По странице модели модальности жёстко ограничены: audio input only и text output only. Если вы отправляете звонки, интервью или внутренние встречи, считайте, что содержимое аудио уходит в OpenAI API, и планируйте доступы соответственно.
В предоставленном пакете подтверждено, что страницы data controls OpenAI распространяются на audio transcription, translation и speech endpoints. Для ЕЭЗ вместе со Швейцарией, а также для Австралии, Канады, Японии, Индии, Сингапура, Южной Кореи, Великобритании и ОАЭ отмечено требование MAM или ZDR.
Что не хватает для полноценной юридической проверки: в этом source pack нет отдельной ссылки на Privacy Policy OpenAI и нет достаточного подтверждения режима использования аудиоданных для обучения именно в вашем сценарии. Поэтому честный вывод такой: для compliance нельзя опираться только на эту карточку; перед запуском проверьте актуальную страницу data controls, настройки организации и юридические документы OpenAI.
Если вы идёте через открытый репозиторий, маршрут хранения и обработки данных определяется уже вашей инфраструктурой, а не только документацией OpenAI. Это может быть практическим плюсом, но сам пакет не содержит готовых гарантий по хранению, региону или срокам ретенции.
Плюсы и минусы
Плюсы
- Один стек покрывает многоязычное распознавание речи, speech translation и language identification.
- API поддерживает несколько полезных форматов результата, включая
srt,vttи структурированные JSON-варианты. - Есть открытый репозиторий с установкой через pip; это удобно для команд, которым нужен не только облачный вызов.
- Репозиторий не выглядит заброшенным: на момент проверки верхняя запись в релизах и changelog —
v20250625. - Исходная статья описывает очень крупный обучающий корпус: 680 000 часов размеченного аудио, включая 117 000 часов по 96 другим языкам и 125 000 часов переводческих данных.
Минусы
- Whisper не принимает видео: только аудиовход и только текстовый выход.
- В актуальной документации OpenAI уже есть более новые альтернативы для транскрибации и realtime, поэтому
whisper-1— не обязательно лучший выбор для нового проекта. - В локальном CLI модель
turboиспользуется по умолчанию, но не обучалась для translation tasks. - В source pack нет второй независимой страницы с ценой и нет отдельной Privacy Policy, так что закупку и юридическое согласование по одной карточке закрыть нельзя.
- Точный набор поддерживаемых входных форматов и streaming-нюансов нужно перепроверять в текущем audio reference перед внедрением.
Доступность и язык
- Платформы: API OpenAI; open-source пакет/CLI на Python. Отдельный список поддерживаемых ОС в этом пакете не зафиксирован.
- Русский язык: модель описана как многоязычная. Отдельный русский интерфейс в официальных источниках из пакета не описан.
- Доступность для РФ: официальные источники из пакета не дают отдельного статуса для России. Поэтому нельзя честно утверждать ни работу без VPN, ни блокировку как общий факт. Доступность аккаунта и оплаты для РФ нужно проверять в текущем кабинете OpenAI.
- Региональные caveats: для ЕЭЗ + Швейцарии, Австралии, Канады, Японии, Индии, Сингапура, Южной Кореи, Великобритании и ОАЭ для аудио-эндпоинтов отмечено требование
MAMилиZDR. - Способы оплаты: в предоставленном пакете не раскрыты.
Альтернативы
- GPT-4o Transcribe — более новый путь внутри OpenAI для speech-to-text; если вы строите новый API-пайплайн, его стоит сравнить с whisper-1 до внедрения.
- GPT-4o mini Transcribe — более дешёвая транскрибация внутри линейки OpenAI; в audio reference для некоторых GPT-4o transcription-вариантов отмечены более жёсткие ограничения по форматам ответа, чем у Whisper.
- GPT-Realtime-Whisper — вариант для низкой задержки и потоковой речи, а не для классической пакетной расшифровки.
- Whisper vs AssemblyAI для транскрибации: что выбрать — если сравниваете OpenAI с отдельным ASR-провайдером, этот материал удобнее, чем читать спецификации по отдельности.
- Whisper vs Deepgram: что выбрать для распознавания речи — полезно, если вам важны не только цена и форматы, но и общий профиль провайдера.
Практический вердикт
Если вам нужна недорогая и понятная пакетная транскрибация аудио в OpenAI, whisper-1 всё ещё имеет смысл: цена на странице модели указана поминутно, форматы вывода удобные, а у проекта есть открытый репозиторий. Если же вы начинаете интеграцию с нуля и вам важны realtime-сценарии или более свежая линейка моделей OpenAI, сначала сравните Whisper с GPT-4o transcription-моделями.
Редакционное ограничение: в этом пакете нет отдельной Privacy Policy и второй независимой ценовой страницы для whisper-1, поэтому карточка годится для короткого отбора инструмента, но не заменяет финальную юридическую и закупочную проверку.
Источники
- Whisper Model | OpenAI API
- Audio | OpenAI API Reference
- Data controls in the OpenAI platform
- GitHub – openai/whisper: Robust Speech Recognition via Large-Scale Weak Supervision
- Releases · openai/whisper
- whisper/CHANGELOG.md at main · openai/whisper · GitHub
- Robust Speech Recognition via Large-Scale Weak Supervision
- GPT-4o Transcribe Model | OpenAI API
- GPT-4o mini Transcribe Model | OpenAI API
- GPT-Realtime-Whisper Model | OpenAI API
Вопросы и ответы
Можно ли транскрибировать видео через Whisper?
Нет. По официальной странице модели Whisper принимает только аудио и возвращает только текст. Видео как вход не поддерживается.
Whisper умеет переводить речь?
Да, официальная страница модели относит Whisper к general-purpose speech recognition для multilingual speech recognition, speech translation и language identification. Но в open-source CLI модель turbo по умолчанию не обучалась для translation tasks.
Сколько стоит whisper-1?
На странице модели указано $0.006/мин за transcription. Важно ограничение: в предоставленном пакете нет второй отдельной pricing-страницы, поэтому перед оплатой перепроверьте цену в текущей документации OpenAI.
Какие форматы ответа поддерживаются?
В audio reference перечислены json, text, srt, verbose_json, vtt и diarized_json. Для некоторых GPT-4o transcription-вариантов ограничения по форматам строже, чем у Whisper.
Можно ли использовать Whisper без облака OpenAI?
В пакете подтверждён открытый репозиторий openai/whisper. Для него указаны установка через pip, совместимость с Python 3.8–3.11 и зависимость от ffmpeg. Но условия хранения данных и инфраструктурные расходы в таком сценарии определяете уже вы.