✅ Подходит: разработчикам и командам, которым нужен API для расшифровки аудио, streaming STT и интеграции транскрибации в собственные продукты.
❌ Не подходит: тем, кто ищет готовое пользовательское приложение для заметок или диктовки без кода. По проверенным источникам AssemblyAI — это прежде всего API и SDK, а не конечный desktop- или mobile-инструмент.
💡 Ключевое преимущество: понятный REST-поток с JSON, отдельные EU-эндпоинты для async и streaming STT и быстрый старт через Python/JavaScript SDK.
- Разработчик: AssemblyAI
- Тип: API, web-документация, SDK для Python и JavaScript
- Официальный URL: assemblyai.com/docs
- Дата проверки: 2026-08-14
Практический вердикт редакции: если вам нужен именно программный доступ к speech-to-text и аудиообработке, AssemblyAI выглядит рабочим вариантом: документация актуальна, changelog живой, а базовый сценарий транскрибации описан без двусмысленностей. Редакционное ограничение: в переданном пакете источников нет Privacy Policy, нет подтверждённых данных о доступности и оплате из РФ, а числовые ставки всех моделей не зафиксированы, поэтому эти части карточки отмечены как неполные и требуют отдельной проверки перед закупкой.
Что умеет
- Транскрибировать заранее записанное аудио через REST API или SDK.
- Работать с real-time / streaming STT; для ЕС задокументирован отдельный endpoint
https://streaming.eu.assemblyai.com. - Использовать отдельные разделы платформы для Speech-to-Text, Audio Intelligence и LLM Gateway в документации.
- Поддерживать JavaScript SDK для асинхронной и real-time транскрибации, audio intelligence и последних LeMUR-моделей.
- Поддерживать Python SDK, включая
StreamingClientиAsyncStreamingClient. - Давать машиночитаемую структуру документации через
llms.txt, что полезно для агентных сценариев и внутренней автоматизации.
С технической стороны публичный REST API использует JSON-запросы и JSON-ответы, а основной base URL подтверждён как https://api.assemblyai.com с версионированием по пути, например /v2. Это удобно, если вы строите собственный пайплайн и хотите минимально зависеть от GUI.
На момент проверки в официальном package.json JavaScript SDK указан как версия 4.36.7, а требование по Node.js — >=18. Changelog поддерживается активно; в нём есть запись от 2026-04-29 с анонсом Voice Agent API. Для быстро меняющихся AI-инструментов это хороший сигнал, но не гарантия стабильности отдельных фич.
Как использовать
- Получите API key в dashboard. Для quickstart AssemblyAI прямо требует действующий ключ.
- Выберите стек: Python 3.8+ или Node.js 18+ для SDK, либо чистый HTTP. Если вы хотите начать без лишней обвязки, достаточно одного запроса на создание транскрипта.
- Отправьте запрос на создание транскрипции: через SDK в one-call flow или через raw HTTP на
POST /v2/transcript. - Проверяйте статус до завершения: quickstart рекомендует ждать состояние
transcript.status == completed; в HTTP-варианте для этого используетсяGET /v2/transcript/{id}. - После завершения читайте
transcript.textи уже на своей стороне сохраняйте, индексируйте или отправляйте текст в следующий этап обработки.
POST https://api.assemblyai.com/v2/transcript
GET https://api.assemblyai.com/v2/transcript/{id}
Если ваш проект должен оставаться в ЕС, смотрите на региональные адреса: для async STT задокументирован https://api.eu.assemblyai.com, для streaming STT — https://streaming.eu.assemblyai.com. В том же обзоре API отдельно сказано, что LLM Gateway в ЕС сейчас не поддерживается. Для команд с требованиями к региональной обработке данных это нужно учитывать в архитектуре заранее.
Сколько стоит: тарифы и ограничения
| План / режим | Цена | Лимиты / примечания |
|---|---|---|
| Free | Точная цена в исходном пакете не зафиксирована; сверяйте с официальной pricing page | По умолчанию 5 параллельных задач для pre-recorded audio |
| Paid | Точная цена зависит от модели и маршрутизации; сверяйте с official pricing | По умолчанию 200 параллельных задач для pre-recorded audio |
| Global routing | На pricing page показаны именно эти ставки | AssemblyAI отдельно указывает, что отображаемые цены относятся к global routing |
| US/EU in-region routing | На 10% выше ставок, показанных для global routing | Это прямо указано на pricing page как региональная надбавка из-за роста provider costs |
Дата проверки тарифных условий: 2026-08-14.
- Максимум для pre-recorded audio: до 5 GB на запрос.
- Лимит для
/v2/upload: до 2.2 GB. - Длительность аудио: от 160 ms до 10 часов.
- Параллелизм по умолчанию: 5 задач на Free и 200 на paid-планах.
Важная оговорка: в этом брифе нет полного перечня числовых ставок по моделям. Для бюджета и закупки этого недостаточно: pricing page нужно перечитывать непосредственно перед внедрением, особенно если вы выбираете между global и региональной маршрутизацией.
Работа с данными и приватность
- Что видит сервис: по подтверждённым источникам AssemblyAI получает аудиоданные для транскрибации — либо через upload, либо через запрос на транскрипт, а затем возвращает текст и JSON-статус обработки.
- Что ещё участвует в обмене: в streaming-сценариях Node SDK отдельно описывает использование temporary auth tokens для client-facing apps.
- Использование данных для обучения: в переданном наборе источников это не раскрыто. Делать выводы «да» или «нет» было бы некорректно.
- Где обрабатываются данные: подтверждены отдельные EU-эндпоинты для async и streaming STT; это говорит о региональной маршрутизации, но не даёт полного ответа о хранении и сроках retention.
- Privacy Policy: ссылка на политику конфиденциальности в source pack не передана, поэтому её нужно открыть и проверить отдельно на официальном сайте перед использованием чувствительных аудиоданных.
Если для вас критичны требования комплаенса, не ограничивайтесь маркетинговым описанием. При выборе речевого API полезно отдельно смотреть на объяснимость и справедливость модели как на критерии оценки, но в случае AssemblyAI эти характеристики нужно подтверждать уже отдельными документами и собственными тестами.
Плюсы и минусы
Плюсы
- REST API описан прозрачно: JSON, единый base URL и понятное версионирование через
/v2. - Есть EU-эндпоинты для async STT и streaming STT, что упрощает региональную архитектуру.
- Quickstart для pre-recorded audio воспроизводим: ключ, запрос, проверка
status, чтениеtext. - JavaScript SDK покрывает async, real-time, audio intelligence и даёт примеры для временных токенов в клиентских приложениях.
- Продукт выглядит активным: changelog обновляется, есть запись о Voice Agent API от 2026-04-29.
Минусы
- По переданным источникам невозможно зафиксировать полный список актуальных числовых цен по моделям; для закупки придётся перепроверять pricing вручную.
- LLM Gateway, по официальному overview, сейчас не поддерживается в ЕС.
- Python SDK README прямо предупреждает, что он рассчитан на testing и light usage, а не на production-scale traffic.
- Порог по окружению не минимальный: JavaScript SDK требует Node.js 18+, а quickstart для SDK — Python 3.8+ или Node.js 18+.
- Критичные для enterprise вопросы — Privacy Policy, хранение данных, доступность оплаты из РФ — не подтверждены в этом source pack.
Доступность и язык
- Платформы: web-документация, REST API, JavaScript SDK, Python SDK.
- Региональные endpoints: подтверждены global и EU-маршруты для async/streaming STT.
- Русский язык интерфейса: в переданных источниках не подтверждён. Документация и репозитории, которые были проверены, англоязычные.
- Доступность для РФ: в source pack нет проверенных данных о необходимости VPN, о работе биллинга и о фактической доступности из РФ.
- Способы оплаты: не подтверждены переданными источниками.
Если вы выбираете стек под исследовательские или агентные сценарии, полезно держать под рукой базовые термины вроде self-attention и transfer learning. Это не описание конкретной реализации AssemblyAI, а скорее минимум для осмысленного сравнения любых современных speech/LLM API.
Альтернативы
Честное ограничение: в переданном пакете нет проверенных официальных источников по прямым конкурентам AssemblyAI и нет утверждённых внутренних карточек-замен, на которые можно безопасно сослаться. Поэтому редакция не перечисляет альтернативы по памяти и не подменяет факт предположением.
Практически это означает следующее: если вы сравниваете AssemblyAI с другими речевыми API, проверяйте по одной и той же схеме не только качество транскрипции, но и региональные endpoints, лимиты на upload, правила по concurrency, наличие streaming, условия для клиентских токенов и прозрачность документации. Для чувствительных проектов отдельно сверяйте политику хранения, комплаенс и поведение в EU-регионе.
Источники
- AssemblyAI Documentation
- API Overview
- Transcribe an audio file
- AssemblyAI Pricing
- AssemblyAI Changelog
- assemblyai-node-sdk
- assemblyai-node-sdk package.json
- assemblyai-python-sdk README
Вопросы и ответы
AssemblyAI — это веб-сервис или API?
По проверенным источникам это прежде всего REST API с JSON-запросами и JSON-ответами, плюс SDK для Python и JavaScript. Документация живёт отдельно как web-хаб.
Есть ли у AssemblyAI EU-эндпоинты?
Да. В official API overview указаны https://api.eu.assemblyai.com для async STT и https://streaming.eu.assemblyai.com для streaming STT. Там же сказано, что LLM Gateway сейчас не поддерживается в ЕС.
Как проверить, что транскрибация завершена?
Quickstart предлагает дождаться состояния transcript.status == completed и затем читать transcript.text. В raw HTTP-потоке для этого используется повторный запрос GET /v2/transcript/{id}.
Какие лимиты у pre-recorded audio?
На момент проверки документация указывает до 5 GB на запрос, до 2.2 GB для /v2/upload, длительность аудио от 160 ms до 10 часов и дефолтный параллелизм 5 задач на Free против 200 на paid-планах.
Можно ли сразу брать Python SDK в продакшн?
С осторожностью. README Python SDK прямо предупреждает, что он предназначен для testing и light usage, а не для production-scale traffic. Для боевой нагрузки это нужно отдельно валидировать архитектурно и нагрузочными тестами.