COMRAD404 / HOWTO

Как озвучить текст с ElevenLabs: создать голос и сгенерировать аудио

Пошаговая инструкция по ElevenLabs: проверьте доступ, создайте API key, сгенерируйте preview в Voice Design, сохраните свой голос и получите MP3 через Text to Speech API.

Понадобится

20–35 минут
  • Аккаунт ElevenLabs и доступ к dashboard
  • Возможность создать API key
  • Понимание, в каком окружении вы работаете: global или изолированный регион
  • Текстовое описание желаемого голоса
  • Текст, который нужно озвучить
  • Для работы из кода: Python или Node.js

После выполнения этой инструкции вы создадите синтетический голос в ElevenLabs и получите аудиофайл из своего текста через официальный Text to Speech API.

Короткий ответ: на 2026-08-17 самый воспроизводимый сценарий такой: создайте API key, получите preview голоса через Voice Design, сохраните выбранный вариант как постоянный голос и отправьте текст в POST /v1/text-to-speech/:voice_id. Важное ограничение: ElevenLabs официально ограничивает доступ из России, Беларуси, Кубы, Ирана, Северной Кореи, Сирии, а также Крыма, Донецка и Луганска.

  • Время: 20–35 минут
  • Сложность: средний
  • Стоимость: есть Free-план с 10,000 credits; точный расход зависит от модели, формата и текущего плана
  • Что потребуется: аккаунт ElevenLabs, доступ к dashboard, API key, текстовое описание голоса, текст для озвучки; при работе из кода — Python или Node.js
  • Актуальность: инструкция сверена по официальной документации ElevenLabs на 2026-08-17; в supplied sources нет публичного номера версии веб-интерфейса. На страницах репозиториев видны релизы Python SDK v2.52.0 и JS SDK v2.50.0, но перед pinning зависимостей проверьте их ещё раз

Редакционное ограничение: source pack подтверждает точный путь Voice Design в приложении и API-поток создания/озвучки, но не фиксирует, где именно в текущем веб-интерфейсе всегда удобнее копировать voice_id. Поэтому ниже используется путь через официальный API Explorer и документированные endpoint’ы: так вы видите идентификаторы прямо в ответах и не зависите от скрытых изменений UI.

Подготовка

Если вы хотите работать из кода, официальные SDK устанавливаются так:

pip install elevenlabs
npm install @elevenlabs/elevenlabs-js

Для всех API-запросов ElevenLabs использует API key в заголовке xi-api-key. Если вы работаете в изолированных окружениях EU, India или Singapore, документация отдельно предупреждает: там нужны другой API URL и отдельный API key.

Пошагово: как создать голос и сгенерировать аудио

  1. Шаг 1. Проверьте, доступен ли для вас сервис и какое окружение вы используете.

    Сначала убедитесь, что ваш аккаунт и география не попадают под официальные ограничения ElevenLabs. Если вас заблокировали ошибочно, сама компания рекомендует писать на [email protected]. Отдельно решите, будете ли вы работать в глобальном окружении или в изолированном регионе.

    С 2026-02-09 глобальная маршрутизация включена по умолчанию, а api-global-preview.elevenlabs.io помечен как deprecated. Если у вас старые скрипты или шаблоны запросов, не переносите их в продакшн без сверки с текущей документацией по окружению.

    Ожидаемый результат: вы понимаете, можете ли использовать сервис, и знаете, нужен ли вам отдельный региональный API URL и отдельный ключ.

  2. Шаг 2. Создайте API key в dashboard и подготовьте его для запросов.

    Откройте dashboard ElevenLabs и создайте API key. Официальная документация указывает, что этот ключ нужно передавать в заголовке xi-api-key.

    xi-api-key: YOUR_API_KEY

    Не вставляйте ключ в клиентский код, публичный репозиторий или скриншоты. Если вы используете изолированное окружение EU, India или Singapore, создайте отдельный ключ именно для него: глобальный ключ там не заменяет региональный.

    Ожидаемый результат: у вас есть рабочий API key, который вы можете использовать в API Explorer, скрипте или HTTP-клиенте.

  3. Шаг 3. Сгенерируйте preview голоса через Voice Design.

    Самый понятный no-code путь в приложении сейчас такой: Voices → My Voices → Add a new voice → Voice Design. Там вы задаёте текстовое описание желаемого голоса и запускаете генерацию. Официальная документация подтверждает, что один запуск создаёт три варианта preview, а списание зависит от количества символов в preview-тексте и происходит один раз за цикл генерации.

    Если вам нужен полностью воспроизводимый API-поток, откройте страницу Design a voice в официальной документации и отправьте запрос к POST /v1/text-to-voice/design. Для следующего шага зафиксируйте generated_voice_id того preview, который вам подходит.

    POST /v1/text-to-voice/design
    Headers:
      xi-api-key: YOUR_API_KEY
    Результат:
      несколько preview и generated_voice_id для каждого варианта

    Ожидаемый результат: у вас есть три preview-версии нового голоса и generated_voice_id выбранного варианта.

  4. Шаг 4. Сохраните выбранный preview как постоянный голос.

    Теперь превратите выбранный preview в постоянный голос через endpoint POST /v1/text-to-voice. По официальной документации для этого используются поля voice_name, voice_description и generated_voice_id.

    POST /v1/text-to-voice
    Headers:
      xi-api-key: YOUR_API_KEY
    Body fields:
      voice_name
      voice_description
      generated_voice_id

    После успешного запроса API Explorer показывает объект созданного голоса. Скопируйте оттуда voice_id: именно его вы подставите в запрос озвучки.

    Ожидаемый результат: preview сохранён как постоянный голос, и у вас есть его voice_id.

  5. Шаг 5. Отправьте текст в Text to Speech и получите аудио.

    Для генерации речи используйте POST /v1/text-to-speech/:voice_id. Официальный quickstart показывает стартовую конфигурацию с model_id='eleven_v3' и output_format='mp3_44100_128'.

    POST /v1/text-to-speech/:voice_id
    Headers:
      xi-api-key: YOUR_API_KEY
    Body fields:
      text
      model_id = eleven_v3
      output_format = mp3_44100_128

    eleven_v3 — текущая самая выразительная TTS-модель ElevenLabs. Документация отдельно отмечает её сильные стороны: audio tags, dialogue mode и поддержку 70+ языков. Но там же есть важная оговорка: у модели выше задержка, поэтому она не подходит для real-time и conversational use cases.

    Если вам нужна не максимальная выразительность, а иной баланс по скорости или расходу, сверяйтесь со страницами Models и Pricing перед массовой генерацией.

    Ожидаемый результат: вы получаете аудиоответ в выбранном формате и можете сохранить его как MP3.

  6. Шаг 6. Сохраните файл и локально прослушайте результат.

    Официальный quickstart использует локальное воспроизведение, поэтому после получения ответа сохраните MP3 и сразу его прослушайте. Это самый быстрый способ понять, подходит ли голос под вашу задачу: ролик, подкаст, объясняющее видео или тестовый прототип.

    Если качество не устраивает, не пытайтесь «докручивать» тот же voice blindly. Для Voice Design это часто означает: вернуться к шагу preview, переписать описание голоса и сгенерировать новую тройку вариантов. Документация прямо называет Voice Design экспериментальной возможностью, поэтому вариативность результата — ожидаемое поведение.

    Ожидаемый результат: у вас есть готовый аудиофайл, который открывается локально и соответствует исходному тексту.

Как проверить, что всё работает

  • Прослушайте файл. Официальная документация считает успешное воспроизведение основным признаком того, что TTS-запрос выполнен корректно.
  • Проверьте заголовки ответа. Документация по API рекомендует смотреть служебные заголовки, например character-cost и request-id. Так вы увидите стоимость запроса в символах/кредитах и сможете сопоставить конкретный вызов с логами.
  • Проверьте идентификаторы. У вас должен сохраниться постоянный voice_id, а не только временный generated_voice_id из preview.
  • Сделайте повторный короткий запрос. Отправьте ещё один короткий текст в тот же voice_id. Если ответ снова приходит и голос совпадает по характеру, связка «голос + TTS» работает.

Частые ошибки и исправления

  • Ошибка: запросы не проходят из-за доступа к платформе.

    Решение: проверьте, не попадаете ли вы под официальные страновые ограничения ElevenLabs. Если блокировка кажется ошибочной, компания рекомендует написать на [email protected].

  • Ошибка: ключ есть, но API не принимает авторизацию.

    Решение: убедитесь, что вы передаёте ключ именно в заголовке xi-api-key. Если вы работаете в EU, India или Singapore, используйте отдельный API key и региональный API URL для этого окружения.

  • Ошибка: вы пытаетесь озвучить текст по generated_voice_id.

    Решение: сначала сохраните preview через POST /v1/text-to-voice и работайте уже с постоянным voice_id.

  • Ошибка: озвучка слишком медленная для бота или звонка.

    Решение: не используйте eleven_v3 для real-time и conversational-сценариев. Документация прямо предупреждает о более высокой задержке у этой модели.

  • Ошибка: расход credits оказался выше ожидаемого.

    Решение: проверяйте live-страницу Pricing перед серийной генерацией. Free-план включает 10,000 credits, но фактический расход зависит от модели и плана; кроме того, preview в Voice Design тарифицируется по символам preview-текста за цикл генерации.

Безопасность и ограничения

  • Не храните API key в открытом виде. Передавайте его только через безопасное хранилище секретов или серверную конфигурацию.
  • Проверяйте регион. Для EU, India и Singapore нужны отдельные API URL и отдельные ключи; автоматический перенос глобальных настроек туда не гарантирован.
  • Не используйте deprecated hostname. После изменения маршрутизации в феврале 2026 года старый api-global-preview.elevenlabs.io не стоит использовать в новых интеграциях.
  • Voice Design экспериментален. Качество может заметно меняться от формулировки описания. Если вам нужна максимально стабильная продакшн-озвучка, официальные материалы предлагают учитывать Professional Voice Clones как более предсказуемый вариант, если у вас есть подходящие исходные записи.
  • Стоимость нельзя фиксировать раз и навсегда. В source pack нет одной универсальной цены за любой TTS-запрос. Для V2 Multilingual указано соотношение 1 character = 1 credit, а некоторые V2 Flash/Turbo и V2.5 Flash/Turbo API generations стоят 0.5–1 credit per character. Перед продакшн-запуском сверяйте актуальную страницу цен.
  • Практический вердикт: для единичных озвучек и прототипов связка Voice Design + TTS удобна уже сейчас. Для real-time, строгой предсказуемости голоса и бюджетирования на больших объёмах сначала проверьте модель, регион и live pricing.

Что делать дальше

  • Посмотрите карточку инструмента ElevenLabs, чтобы быстро перейти к официальным возможностям и сценариям использования.
  • Если вам нужен говорящий персонаж, продолжите с инструкцией Как сгенерировать аватар-видео с HeyGen.
  • Если вы хотите автоматически готовить тексты для озвучки, настройте своего GPT под сценарии дикторских текстов.
  • Если хотите встроить озвучку в цепочку с ботом и логикой, посмотрите как создать чатбота с Flowise.

Источники

Вопросы и ответы

Можно ли сделать всё без кода?

Часть потока — да: Voice Design доступен в приложении по пути Voices → My Voices → Add a new voice → Voice Design. Но для максимально воспроизводимого сценария создания постоянного голоса и генерации аудио эта инструкция опирается на официальные API endpoint’ы и Explorer.

Какую модель брать первой?

Если вам важнее выразительность, начните с eleven_v3: официальная документация называет её самой новой и самой выразительной моделью, с audio tags, dialogue mode и поддержкой 70+ языков. Если приоритет — низкая задержка, проверяйте другие модели на странице Models.

Сколько это стоит?

Free-план включает 10,000 credits. Дальше цена зависит от модели и плана. Для V2 Multilingual документация указывает 1 character = 1 credit, а часть V2 Flash/Turbo и V2.5 Flash/Turbo API generations тарифицируется в диапазоне 0.5–1 credit per character. Для боевого расчёта смотрите только актуальную страницу Pricing.

Подходит ли Eleven v3 для real-time-бота?

Нет, документация прямо предупреждает, что у eleven_v3 повышенная задержка, поэтому модель не подходит для real-time и conversational use cases.

Почему в разных регионах нужны разные ключи?

Потому что EU, India и Singapore оформлены как отдельные изолированные окружения с собственными API URL и собственными API keys. Глобальная настройка не заменяет региональную.

Шаги

HOW-TO
  1. Проверьте доступ и окружение

    | Убедитесь, что сервис доступен в вашей стране и что вы используете нужное окружение. Для EU, India и Singapore нужны отдельные API URL и отдельные API keys.

  2. Создайте API key

    | Создайте ключ в dashboard ElevenLabs и подготовьте его для запросов через заголовок xi-api-key.

  3. Сгенерируйте preview голоса

    | Используйте Voice Design в приложении или endpoint POST /v1/text-to-voice/design, чтобы получить три preview и выбрать generated_voice_id нужного варианта.

  4. Сохраните постоянный голос

    | Отправьте POST /v1/text-to-voice с voice_name, voice_description и generated_voice_id, затем сохраните полученный voice_id.

  5. Сгенерируйте аудио из текста

    | Вызовите POST /v1/text-to-speech/:voice_id, передайте текст, model_id eleven_v3 и output_format mp3_44100_128, затем получите аудиоответ.

  6. Сохраните и проверьте результат

    | Сохраните MP3, прослушайте его локально и проверьте заголовки ответа, например character-cost и request-id.

Источники

SOURCES

Вопросы и ответы

FAQ
Можно ли сделать всё без кода?

Частично да: Voice Design доступен в приложении по пути Voices → My Voices → Add a new voice → Voice Design. Но для максимально воспроизводимого сценария создания постоянного голоса и генерации аудио инструкция опирается на официальные API endpoint'ы и Explorer.

Какую модель брать первой?

Если вам важнее выразительность, начните с eleven_v3: документация называет её самой новой и самой выразительной моделью, с audio tags, dialogue mode и поддержкой 70+ языков. Если приоритет — низкая задержка, сверяйтесь со страницей Models.

Сколько это стоит?

Free-план включает 10,000 credits. Дальше стоимость зависит от модели и плана. Для V2 Multilingual указано 1 character = 1 credit, а часть V2 Flash/Turbo и V2.5 Flash/Turbo API generations тарифицируется в диапазоне 0.5–1 credit per character. Перед продакшн-запуском проверяйте live pricing.

Подходит ли Eleven v3 для real-time-бота?

Нет. Документация прямо предупреждает, что у eleven_v3 повышенная задержка, поэтому модель не подходит для real-time и conversational use cases.

Почему в разных регионах нужны разные ключи?

Потому что EU, India и Singapore — это отдельные изолированные окружения с собственными API URL и собственными API keys. Глобальная настройка не заменяет региональную.

Читайте также

LINKS