В 2024 году «генеративное аудио» быстро перестало быть одной категорией. Suno и Udio развивали потребительские системы для создания песен из текста, лирики и затем из аудиозаготовок, а GPT‑4o, объявленный OpenAI 13 мая 2024 года, показал другой путь: голосовой интерфейс speech-to-speech, где цель не песня, а быстрый разговорный ответ. Ниже — не обзор рынка на август 2026 года, а исторический разбор по официальным источникам 2024 года.
Для практики это важное различие: сравнивать Suno, Udio и голос GPT‑4o как «три одинаковых аудиогенератора» неудобно и часто просто неверно. У них разные целевые объекты, разные циклы редактирования и разные наборы рисков.
Коротко
- Suno и Udio в 2024 году были прежде всего системами text-to-music: prompt, lyrics, затем extension, remix и работа с более длинным треком.
- GPT‑4o voice — это другой класс продукта: speech-to-speech в реальном времени, а не генератор готовых песен.
- Главная продуктовая гонка 2024 года шла не только за «первый результат», но и за управляемость: длину трека, окно контекста, audio upload, stems, key control.
- По публичной технической прозрачности OpenAI в 2024 году заметно опережала Suno и Udio: у GPT‑4o есть system card, у музыкальных продуктов в цитируемом корпусе — в основном анонсы и release notes.
Контекст
Чтобы понять, почему эти продукты так быстро появились именно в 2024 году, полезно вспомнить исследовательскую базу 2022–2023 годов. Работа AudioLM показала, что аудио можно моделировать как последовательность дискретных токенов и получать правдоподобные continuations. MusicLM показала, что из текстового описания можно синтезировать музыкальный фрагмент. Voicebox отдельно продемонстрировал, насколько далеко продвинулась генерация и редактирование речи.
Но продукты 2024 года пошли в разные стороны. Музыкальные системы пытались сделать из модели «черновик песни по запросу» и быстро добавляли инструменты доработки. Голосовые системы, наоборот, двигались к более естественному разговору в реальном времени, где важны задержка, интонация, безопасность и контроль над голосовой идентичностью.
Поэтому полезнее думать не о едином рынке «генеративного аудио», а как минимум о двух ветках:
- генерация музыки — создание песен, инструменталов, припевов, аранжировок и их extension;
- генерация речи — синтетический голос, speech-to-speech, озвучка, диалог и перевод.
Метод
Поскольку источники по трём системам несимметричны по глубине, этот обзор сравнивает не «качество на одном общем бенчмарке» — такого нейтрального бенчмарка в официальных материалах 2024 года нет, — а пять практических критериев:
- что система генерирует как основной результат;
- чем пользователь управляет на входе;
- есть ли цикл редактирования и продолжения;
- какие ограничения и safeguard-ы явно описаны в официальных материалах;
- насколько подробно раскрыта техническая сторона.
Музыкальная ветка: Suno и Udio
У обеих систем базовый паттерн похож: пользователь задаёт стиль и тему текстом, при необходимости добавляет lyrics, получает короткий или средний музыкальный результат, а дальше не начинает заново, а достраивает, продлевает, ремиксует и постепенно собирает более длинный трек.
Голосовая ветка: GPT‑4o voice
У GPT‑4o логика иная. OpenAI в анонсе и system card подчёркивала end-to-end-модель: аудио, текст и изображение обрабатываются одной сетью, а для голосового режима ключевой метрикой становится естественность разговорного цикла. Это не DAW-замена и не текстовый генератор песен, а мультимодальный разговорный интерфейс.
Результаты
| Система | Что генерирует | Как задаётся управление | Что подтверждено официальными материалами 2024 года | Явные ограничения | Публичная прозрачность |
|---|---|---|---|---|---|
| Suno v3 / v3.5 | Песни из текстового описания и лирики; отдельная instrumental-логика. | Prompt, lyrics, затем Extend; с июня 2024 — Audio Input. |
В материалах Suno v3 фигурируют клипы до 2 минут; v3.5 — генерации до 4 минут и extension до 2 минут. Для Audio Input Suno указывала клипы длиной 6–60 секунд. |
В посте про Audio Inputs Suno отдельно пишет, что copyrighted works блокируются на upload, а inputs с вокалом остаются private и unsearchable. |
В цитируемых материалах 2024 года — продуктовые анонсы и release notes; сопоставимой с system card технической документации нет. |
| Udio | Песни из prompt и собственных lyrics, с последующим extension и remix. | Text prompt, lyrics, extension, remix; с июня 2024 — audio upload. | По официальному пресс-релизу Udio публично запустилась 10 апреля 2024 года. По анонсу от 1 мая лимит трека подняли до 15 минут, а окно контекста для extension — до 2 минут. В анонсе v1.5 добавлены stem downloads, audio-to-audio remix и key control. | В июньском посте Udio требует подтверждать права на загружаемый звук; треки, сделанные с uploaded audio, тогда ещё нельзя было публиковать внутри Udio. | Публичные материалы 2024 года подробно описывают функции продукта, но почти не раскрывают архитектуру, обучение и evaluation. |
| GPT‑4o voice | Разговорный speech-to-speech, а не полноценная генерация песен. | Аудиоввод и аудиоответ в одной end-to-end multimodal model; голоса — из preset-набора. | OpenAI 13 мая 2024 года объявила GPT‑4o и сообщила, что новый Voice Mode с GPT‑4o выйдет в alpha. В system card от 8 августа 2024 года OpenAI сообщает о 232 мс минимальной и 320 мс средней задержке ответа на аудиоввод. | В system card сказано, что output ограничен preset voices; отдельно упомянуты блокировка music outputs и инструкция для limited alpha Advanced Voice Mode не петь. | Из трёх систем именно GPT‑4o имеет наиболее подробное публичное описание рисков, mitigations и ограничений. |
Из таблицы видно, что Suno и Udio в 2024 году сходились по общему продуктному направлению: песня как объект, который удобно не только сгенерировать, но и потом постепенно довести. Различия были в деталях управления и редактирования: Suno быстро двигалась в сторону коротких аудиовходов и extension, Udio — в сторону длинного контекста, remix-аудио и более явного музыкального контроля вроде key control и stem downloads.
GPT‑4o voice стояла в стороне от этой логики. По официальным материалам OpenAI, её сильная сторона — естественный разговорный цикл и низкая задержка, а не производство музыкального трека. Более того, сама OpenAI в 2024 году ограничивала музыкальные сценарии: в system card прямо описаны блокировки music outputs и запрет на пение для limited alpha.
Интерпретация
Наш комментарий
Если смотреть на 2024 год без рекламного шума, то главная история здесь не в том, что «появился один универсальный аудио-ИИ». Скорее произошло разделение на две отдельные продуктовые линии: музыкальные генераторы-редакторы и разговорные голосовые модели.
Для практиков это меняет способ оценки. У музыкального продукта важны не только первый проход по prompt, но и то, как он продолжает трек, держит структуру, позволяет работать с загруженным аудио и насколько удобно встраивается в реальный songwriting-loop. У голосовой модели важнее latency, устойчивость к misuse, контроль идентичности голоса, работа с интонацией и безопасное поведение в разговоре.
Есть и третья линия, которая часто недооценивается: безопасность теперь встроена в сам объект генерации. Для Suno и Udio это вопрос прав на исходный звук и обращения с загружаемым аудио. Для GPT‑4o voice — вопрос имперсонации, speaker identification, copyrighted audio и того, насколько модель может выходить за пределы разрешённого набора голосов.
Ограничения
- Нет общего нейтрального бенчмарка. В первичных источниках 2024 года нет единой воспроизводимой таблицы, по которой можно честно измерить Suno, Udio и GPT‑4o voice на одной шкале качества.
- Источники неравномерны по прозрачности. OpenAI опубликовала system card, а Suno и Udio в основном ограничились product posts и release notes. Поэтому сильные утверждения о различиях архитектур здесь делать нельзя.
- Это исторический срез 2024 года. Многие страницы к 2026 году уже содержат более поздние обновления продукта, но в тексте выше использован именно тот объём фактов, который подтверждает состояние 2024 года.
- Юридические и датасетные вопросы остаются частично непрозрачными. Официальные материалы описывают правила upload-а и safeguards, но не дают полного ответа о составе обучающих данных и независимой аудиторской проверке.
Вывод
В 2024 году Suno и Udio показали, как генерация музыки превращается из «сделай мне песню по prompt» в цикл черновика, extension и доработки. GPT‑4o voice показала другое направление: end-to-end speech-to-speech с упором на естественный диалог и жёсткие ограничения вокруг голосовой идентичности и музыкального контента.
Главный практический вывод простой: «генеративное аудио» — это не одна задача и не один benchmark. Песню, озвучку и разговорный голосовой интерфейс лучше оценивать по разным критериям, иначе сравнение быстро становится вводящим в заблуждение.
Источники
- AudioLM: a Language Modeling Approach to Audio Generation — исследовательский контекст для LM-подхода к генерации аудио и continuations.
- MusicLM: Generating Music From Text — исследовательский контекст для text-to-music.
- Voicebox: Text-Guided Multilingual Universal Speech Generation at Scale — исследовательский контекст для современной генерации и редактирования речи.
- Introducing v3 · Suno — подтверждает выпуск Suno v3 и двухминутный формат песен.
- Suno Release Notes — подтверждает этапы v3, v3.5, Audio Input и связанные длины/режимы.
- Audio Inputs · Suno — подтверждает Audio Input, диапазон 6–60 секунд и описанные ограничения по uploaded audio.
- Former Google Deepmind Researchers Assemble Luminaries Across Music And Tech To Launch Udio, A New AI-Powered App That Allows Anyone To Create Extraordinary Music In An Instant — подтверждает публичный запуск Udio 10 апреля 2024 года.
- Longer Track Length and Long Context (More Coherent Songs) — подтверждает увеличение лимита трека до 15 минут и рост окна контекста для extension.
- Audio Uploads, WAV Downloads, Mobile Improvements — подтверждает audio upload, extension на uploaded audio и правила публикации.
- Introducing v1.5 — подтверждает stem downloads, audio-to-audio remix, key control и другие возможности Udio v1.5.
- Hello GPT-4o — подтверждает анонс GPT‑4o 13 мая 2024 года, end-to-end-мультимодальность и rollout voice alpha.
- GPT-4o System Card — подтверждает voice-related risks, preset voices, блокировку music outputs и заявленную latency.
FAQ
Можно ли считать GPT‑4o прямым конкурентом Suno и Udio?
Не совсем. По официальным материалам 2024 года GPT‑4o voice — это прежде всего разговорный speech-to-speech-интерфейс. Suno и Udio — системы для генерации и доработки музыкальных треков.
Почему Suno и Udio сравнивают друг с другом чаще, чем с GPT‑4o?
Потому что их пользовательский цикл ближе: prompt, lyrics, генерация трека, extension, remix, работа с audio input. У GPT‑4o другой целевой объект и другой UX.
Что было важнее в музыкальных продуктах 2024 года: разовая генерация или редактируемость?
Судя по официальным обновлениям Suno и Udio, именно редактируемость быстро стала центральной темой: длина трека, extension, audio upload, stems и более явный музыкальный контроль.
Почему в статье так мало утверждений о «качестве звука»?
Потому что первичные источники 2024 года почти не дают нейтрального межплатформенного сравнения. Там много product claims, но мало воспроизводимых независимых оценок в одном формате.
