После выполнения этой инструкции вы создадите клон собственного голоса для озвучки и проверите его на тестовом тексте. Самый быстрый текущий managed-путь по официальной документации — ElevenLabs Instant Voice Cloning: он использует менее 2 минут аудио и делает голос доступным почти сразу после сохранения.
Практический вердикт: если вам нужно быстро озвучить текст своим голосом без локальной настройки, начинайте с ElevenLabs IVC. Если нужен API-поток и статусы обучения через webhook, смотрите Resemble AI. Если вы редактируете текст и речь в одном редакторе, удобнее Descript. Если нужен self-hosted и открытый код, выбирайте OpenVoice.
- ⏱️ Время: 15–30 минут для быстрого клона и тестовой озвучки; для ElevenLabs Professional Voice Cloning обучение обычно занимает 3–6 часов после подготовки 30–180 минут аудио.
- 🎯 Сложность: начальный уровень для ElevenLabs IVC и Descript; средний для Resemble AI; средний–продвинутый для OpenVoice.
- 💰 Стоимость: зависит от сервиса и текущего плана. По официальным источникам ElevenLabs PVC требует Creator plan or above, Resemble AI Voice Cloning API — Business plan or higher; у Descript лимиты зависят от плана; OpenVoice распространяется по MIT, но вычисления и хостинг — на вашей стороне.
- 🛠️ Что потребуется: ваша собственная чистая запись голоса, аккаунт в выбранном сервисе, подтверждение прав/согласия; для OpenVoice — локальная среда и работа с репозиторием.
- 📌 Актуальность: официальные веб-документы и репозиторий по состоянию на 2026-08-19. У рассмотренных managed-сервисов в источниках нет фиксированных публичных номерных версий интерфейса, поэтому ориентир — текущая документация на указанную дату.
Редакционное ограничение: в пакете источников есть покнопочный текущий маршрут для ElevenLabs IVC и Descript. Для Resemble AI и OpenVoice официально подтверждён прежде всего API/repository flow, поэтому основной воспроизводимый walkthrough ниже дан через ElevenLabs, а альтернативы описаны настолько подробно, насколько это подтверждают источники.
Как выбрать инструмент под ваш сценарий
| Инструмент | Когда выбирать | Что важно учесть |
|---|---|---|
| ElevenLabs Voice Cloning | Нужен самый быстрый managed-workflow для озвучки | IVC лучше подходит для коротких чистых записей; PVC требует верификации и Creator plan или выше |
| Resemble AI Voice Cloning | Нужен API-first подход с dataset URL, отдельными recordings и webhook | Voice Cloning API требует Business plan или выше; голос готов только после training status=finished |
| Descript Overdub / AI Speakers | Нужно сразу писать текст и генерировать речь в редакторе | Можно клонировать только собственный голос и нужен явный consent; лимиты зависят от плана |
| OpenVoice | Нужен self-hosted или исследовательский сценарий | Это open-source проект без managed SLA; установка и checkpoints зависят от состояния репозитория и вашей инфраструктуры |
Пошагово: самый быстрый путь через ElevenLabs Instant Voice Cloning
- Выберите быстрый режим клонирования.
Откройте ElevenLabs и перейдите в
Voices. Нажмите значок плюса и выберитеInstant Voice Clone.Ожидаемый результат: вы видите текущую форму создания быстрого клона голоса.
- Загрузите или запишите образец собственного голоса.
В текущем официальном потоке можно либо загрузить аудио, либо записать его прямо в процессе создания клона. Для IVC документация рекомендует короткий материал: режим использует менее 2 минут аудио и работает почти сразу.
Ожидаемый результат: образец прикреплён и готов к следующему шагу.
- Подтвердите права и согласие.
Перед сохранением подтвердите, что у вас есть права на использование этого голоса и необходимое согласие. Это обязательная часть текущего официального потока ElevenLabs.
Ожидаемый результат: система позволяет перейти к сохранению клона.
- Сохраните голос.
Нажмите
Save voice. После сохранения клон должен появиться в списке ваших голосов.Ожидаемый результат: голос доступен в разделе
My Voices. - Откройте клон для использования.
Перейдите в
My Voicesи нажмитеUse voice. Это текущая официально описанная точка входа для дальнейшей озвучки текста вашим клоном.Ожидаемый результат: вы попадаете в интерфейс, где можно использовать созданный голос для синтеза речи.
- Сделайте тестовую озвучку.
Введите короткий нейтральный текст и сгенерируйте пробную озвучку в открывшемся потоке использования голоса. Точная кнопка запуска генерации в рассмотренных страницах не фиксируется, поэтому ориентируйтесь на текущий интерфейс внутри
Use voice.Ожидаемый результат: вы получаете тестовый аудиофрагмент, по которому можно оценить сходство тембра и чистоту результата.
Если нужен более точный клон: ElevenLabs Professional Voice Cloning
Если быстрого клона недостаточно по качеству, переходите к Professional Voice Cloning. По текущей документации ElevenLabs этот режим требует 30–180 минут аудио, обычно занимает 3–6 часов на fine-tuning и доступен на Creator plan или выше.
Для PVC нужен этап верификации голоса. Если CAPTCHA не проходит, официальный совет — попробовать снова через 24 часа. Статус готовности проверяется в My Voices, а также приходит по email.
Для API-сценариев полезны два официальных changelog: с 2025-04-21 ElevenLabs добавил отдельный набор PVC API для программного создания и обучения голосов, а с 2025-06-30 — параметр remove_background_noise для очистки sample audio перед тренировкой. Это особенно полезно, если у вас архив записей неидеального качества.
Альтернативы, если ElevenLabs вам не подходит
Descript: если вы озвучиваете текст прямо в редакторе
Текущий официальный поток Descript для собственного голоса такой: Add speaker label → Create speaker → Enable speech generation → записать consent statement на английском → Submit. По help-center подтверждение обычно приходит через несколько минут.
Проверка результата тоже зафиксирована: в Write mode напишите текст, назначьте Speaker и нажмите Done writing. После этого сервис автоматически сгенерирует AI speech. На странице TTS указано, что custom voice clones работают через выбранную voice generation model.
По ограничениям есть два важных пункта: Descript разрешает клонировать только собственный голос и требует явное согласие; кроме того, лимиты Overdub зависят от плана. Текущая pricing page показывает Unlimited на Pro и 1,000-word vocabulary на Creator и Free, но перед покупкой это нужно перепроверить на официальной странице.
Resemble AI: если нужен API и контроль статусов
У Resemble AI официально есть два пути обучения голоса: через dataset file или через individual recordings. Базовый поток в документации такой: сначала POST /api/v2/voices, затем добавление /recordings или передача dataset_url, после чего вызов /build.
Важно: /build требует активную запись или custom dataset. Голос считается готовым только после training status=finished; этот статус можно ловить и через callback_uri, который получает webhook с finished. После этого клон готов для Text-to-Speech и Speech-to-Speech.
Ограничение по доступу жёсткое: официальная документация указывает, что Voice Cloning API требует Business plan или выше.
OpenVoice: если нужен self-hosted и открытый код
OpenVoice — это open-source проект под MIT license. В README указано, что версия V2, выпущенная в апреле 2024, добавляет native multilingual support для English, Spanish, French, Chinese, Japanese и Korean.
Официальный usage guide предлагает два варианта: быстрый запуск через уже развернутые сервисы или локальную установку через обычный поток вида conda create → git clone → pip install -e . → demo notebooks / local Gradio demo. Это подходит скорее для исследовательского и self-hosted сценария, чем для быстрого офисного production-потока.
Дополнительное подтверждение сценария даёт публикация OpenVoice на arXiv: она описывает zero-shot cross-lingual voice cloning по короткому аудиоклипу и прямо указывает, что исходный код и обученные модели доступны публично.
Как проверить, что всё работает
- ElevenLabs IVC: ваш голос появился в
My Voices, открывается черезUse voice, а тестовая озвучка слышимо близка по тембру и не содержит явного фонового шума. - ElevenLabs PVC: клон получил статус готовности в
My Voicesи/или вы получили email о завершении обучения. - Descript: после назначения
Speakerи нажатияDone writingсервис автоматически создаёт AI speech для введённого текста. - Resemble AI: training status стал
finishedили webhook вcallback_uriподтвердилfinished; после этого голос доступен для TTS и STS. - OpenVoice: локальный demo notebook или Gradio demo отдаёт итоговый аудиофайл на основе короткого референса.
Частые ошибки и исправления
- ❌ Клон в ElevenLabs создался, но звучит грязно или не похож на вас.
✅ Решение: повторите IVC с более чистой короткой записью. Если вам нужна более высокая точность, переходите на PVC; для API-потока ElevenLabs отдельно добавил параметрremove_background_noiseдля очистки sample audio. - ❌ В ElevenLabs PVC не проходит проверка голоса.
✅ Решение: по официальной документации при проблеме с CAPTCHA попробуйте пройти её снова через 24 часа. - ❌ В Resemble AI обучение не стартует.
✅ Решение: проверьте prerequisite из документации: для/buildнужна активная запись или custom dataset. - ❌ В Descript custom voice не создаётся или не подтверждается.
✅ Решение: убедитесь, что вы создаёте клон собственного голоса, включилиEnable speech generation, записали consent statement на английском и нажалиSubmit. - ❌ Голос создан, но вы не понимаете, как проверить озвучку.
✅ Решение: в ElevenLabs откройтеMy Voices→Use voice; в Descript используйтеWrite mode, назначьтеSpeakerи нажмитеDone writing; в Resemble дождитесь статусаfinished.
Безопасность и ограничения
- Используйте только собственный голос или голос, на который у вас есть явное согласие. Это прямо отражено в официальных потоках ElevenLabs и Descript.
- Цены и лимиты быстро меняются. Перед оплатой всегда перепроверяйте текущие plan pages и документацию. Особенно это касается Descript и Resemble AI.
- В рассмотренных страницах региональная доступность для ElevenLabs, Resemble AI и Descript явно не указана. Если регион критичен, проверяйте availability/terms отдельно.
- У Descript в официальных материалах есть расхождение по минимальному объёму аудио для обучения в разных публикациях. Для рабочего решения проверяйте текущий app/help именно в день настройки.
- OpenVoice — не managed-сервис. Доступность checkpoints, производительность и стабильность зависят от состояния репозитория и вашей инфраструктуры.
- Для ElevenLabs PVC сроки 3–6 часов указаны как типичные, а не гарантированные для каждого случая.
Что делать дальше
- Если клон уже готов, переходите к инструкции как подключить ElevenLabs для озвучки текста.
- Чтобы писать более убедительные сценарии под озвучку, используйте role prompting для промптов.
- Если вы собираете фактуру для подкаста, курса или дикторского сценария, пригодится NotebookLM для исследований.
- Если хотите хранить и переиспользовать материалы для сценариев, соберите первый RAG-прототип для заметок.
Источники
- Voice Cloning overview | ElevenLabs Documentation
- Instant Voice Cloning | ElevenLabs Documentation
- Professional Voice Cloning | ElevenLabs Documentation
- April 21, 2025 | ElevenLabs Documentation
- June 30, 2025 | ElevenLabs Documentation
- Clone a Voice Overview | Resemble | Documentation
- Build Voice | Resemble | Documentation
- Create a custom voice clone – Descript Help Center
- Generate text-to-speech audio – Descript Help Center
- Price
- GitHub – myshell-ai/OpenVoice: Instant voice cloning by MIT and MyShell. Audio foundation model.
- OpenVoice/docs/USAGE.md at main · myshell-ai/OpenVoice · GitHub
- OpenVoice: Versatile Instant Voice Cloning
Вопросы и ответы
Какой путь самый быстрый, если мне нужно озвучить текст сегодня?
По текущей официальной документации самый быстрый managed-вариант — ElevenLabs Instant Voice Cloning: он использует менее 2 минут аудио и делает голос доступным почти сразу после Save voice.
Можно ли клонировать голос другого человека?
В рамках этой инструкции — нет. Официальные потоки ElevenLabs и Descript требуют подтверждения прав и согласия; Descript прямо ориентирован на создание клона собственного голоса.
Когда стоит выбирать Professional Voice Cloning вместо Instant Voice Cloning?
Когда вам нужен более точный результат и вы готовы подготовить 30–180 минут аудио. В ElevenLabs PVC обычно обучается 3–6 часов и требует Creator plan или выше.
Подходит ли Resemble AI для обычной ручной озвучки без кода?
По рассмотренным источникам Resemble AI сильнее выглядит как API-first вариант: создание голоса идёт через /api/v2/voices, /recordings или dataset_url, а затем /build и статус finished.
Можно ли обойтись без облачного сервиса?
Да, для этого подходит OpenVoice. Но это self-hosted сценарий: вам понадобится локальная установка, работа с репозиторием и собственные вычислительные ресурсы.