Запись архива

GPT-4o: что такое omni-модель и почему это сдвиг

Разбор GPT-4o по первоисточникам OpenAI от 13 мая и 8 августа 2024 года: что означает omni, как единая модель объединяет текст, голос и зрение, и почему это важнее обычной мультимодальности.

Схема работы GPT-4o: текст, аудио, изображение и видео поступают в единую модель и превращаются в текст, аудио и изображение

13 мая 2024 года OpenAI представила GPT-4o как новую флагманскую модель, а 8 августа 2024 года дополнила анонс подробной картой системы (System Card). Эти два документа важны читать вместе: первый объясняет, что именно компания называет omni, второй показывает, какие ограничения, оценки и риски OpenAI зафиксировала после запуска.

В этом разборе под GPT-4o мы имеем в виду именно исторический срез мая–августа 2024 года, без подмены более поздними снапшотами и продуктовыми изменениями. Это важно, потому что вокруг GPT-4o быстро накопилось много вторичных пересказов, где архитектурный тезис смешивается с более поздними интерфейсами ChatGPT и API.

Коротко

  • Omni у OpenAI означает не просто «много модальностей», а одну модель, обученную end-to-end на тексте, зрении и аудио.
  • Главный сдвиг GPT-4o — отказ от старого голосового конвейера из нескольких моделей в пользу единой сети, которая обрабатывает смешанный ввод и генерирует смешанный вывод.
  • На май 2024 года OpenAI заявляла для GPT-4o голосовой отклик до 232 мс при среднем 320 мс, а также цену API на 50% ниже GPT-4 Turbo.
  • Публичный продукт на старте отставал от архитектурного обещания: сначала выкатывались текст и изображения, а остальные модальности — постепенно.
  • System Card фиксирует не только плюсы, но и новые риски: идентификация говорящего, несанкционированная имитация голоса, необоснованные выводы по аудио и изображению, эмоциональная зависимость от голосового интерфейса.

Что такое omni-модель: контекст запуска GPT-4o

До GPT-4o OpenAI уже двигалась к мультимодальности. GPT-4 в материалах OpenAI описывался как модель, способная принимать текст и изображения и выдавать текст, а GPT-4V расширял практическое использование зрительного входа. Но для голоса в продукте по-прежнему использовался составной стек: распознавание речи, затем текстовая модель, затем синтез речи.

Именно против этого старого устройства и направлен термин omni. В анонсе OpenAI прямо пишет, что прежний Voice Mode был конвейером из трёх моделей и из-за этого терял часть сигнала: интонацию, фоновые шумы, перекрывающиеся голоса, эмоциональные оттенки. GPT-4o подаётся как переход от «склейки модальностей» к единой мультимодальной обработке.

Это и есть смысл сдвига. Не в том, что модель «наконец-то научилась слышать», а в том, что звук, картинка и текст перестают быть отдельными этапами обработки и становятся частями одного процесса inference.

Метод: как OpenAI описывает устройство GPT-4o

В первоисточниках OpenAI называет GPT-4o autoregressive omni model. Подтверждённый публично минимум такой: модель принимает любую комбинацию текста, аудио, изображений и видео на входе; генерирует текст, аудио и изображения на выходе; обучена end-to-end на тексте, зрении и аудио; все входы и выходы проходят через одну и ту же нейросеть.

Что важно: OpenAI не раскрыла в этих материалах размер модели, вычислительный бюджет обучения, детальную схему токенизации аудио или точный механизм слияния модальностей. Поэтому корректно говорить только о том, что подтверждено источниками: единая сеть, сквозное обучение и общий путь обработки модальностей.

Старый голосовой стек:
аудио → ASR → текстовая LLM → TTS

GPT-4o:
текст / аудио / изображение / видео → единая модель → текст / аудио / изображение

Из этой схемы следуют два практических эффекта. Первый — меньше потерь на стыках между подсистемами. Второй — более естественный диалог: модель не просто «ждёт транскрипт», а работает с сигналом, который ближе к реальному разговору.

Но важно не перепутать модель и продукт. Уже в майских материалах OpenAI оговаривала, что на старте публично разворачивает прежде всего текстовые и визуальные возможности, а остальные модальности будет выкатывать поэтапно по мере доработки инфраструктуры, post-training и safety-механизмов. То есть слово omni в мае 2024 года описывало прежде всего архитектурную ставку, а не список уже доступных всем функций в один день.

Результаты: что показали анонс и System Card

Если вынести маркетинговый слой за скобки, то по GPT-4o есть несколько действительно содержательных наблюдений, подтверждённых в первоисточниках.

Наблюдение Что подтверждено Почему это важно
Единая мультимодальная модель GPT-4o принимает смешанный ввод из текста, аудио, изображений и видео и генерирует текст, аудио и изображения; обучение описано как end-to-end через одну сеть. Это меняет базовую единицу взаимодействия: вместо цепочки отдельных сервисов — один общий контур обработки.
Голосовая задержка OpenAI заявляет отклик до 232 мс и среднее 320 мс; это сопоставляется с человеческим темпом turn-taking в разговоре. Здесь сдвиг не косметический: при такой задержке голос перестаёт быть «озвученным текстом» и становится похож на разговорный интерфейс.
Экономика API на запуске В анонсе и System Card GPT-4o описывается как модель с ценой API на 50% ниже GPT-4 Turbo. Если мультимодальность дешевеет, она превращается из демо-режима в кандидат на массовое внедрение.
Рамка безопасности По Preparedness Framework у GPT-4o: Low по cybersecurity, Low по biological threats, Medium по persuasion и Low по model autonomy; общий уровень — Medium. OpenAI не утверждает, что модель «безопасна вообще». Утверждение уже и конкретнее: по внутренней рамке запуска она не превышала порог, при котором развёртывание запрещается.
Внешний red teaming OpenAI сообщает о работе с более чем 100 внешними red teamers, говорившими на 45 языках и представлявшими 29 стран. Для голосовой и мультимодальной модели это особенно важно: новая поверхность риска шире, чем у чисто текстовых систем.

Есть и более предметное подтверждение тезиса об улучшении неанглоязычных возможностей. В System Card OpenAI приводит результаты для ряда исторически недопредставленных языков: например, в переведённом ARC-Easy точность на hausa для GPT-4o составила 75.4% против 28.8% у GPT-4, а в переведённом TruthfulQA — 59.2% против 37.6%. Это сильный сигнал, но не повод делать слишком широкий вывод: сама карта системы отдельно отмечает, что разрыв с английским сохраняется и что покрытие таких оценок пока ограничено.

Ещё одна важная деталь — граница свежести знаний. System Card указывает, что возможности GPT-4o были предобучены на данных до октября 2023 года; текущая страница модели в каталоге OpenAI API также указывает knowledge cutoff на октябрь 2023 года. Для практиков это простой вывод: GPT-4o исторически важна как архитектурный шаг, но не как источник автоматически актуальных знаний.

Интерпретация

Наш комментарий

Почему GPT-4o выглядит как сдвиг, даже если не смотреть на привычные лидерборды? Потому что здесь меняется не только качество ответов, а сама форма вычисления. У классического текстового чата базовая единица работы — текстовый ход. У GPT-4o OpenAI пытается сделать базовой единицей смешанный интерактивный контекст: речь, паузы, изображение, текстовые уточнения, потенциально видео.

Это важно для прикладных систем. Ассистент для встреч, переводчик, визуальный помощник, голосовой саппорт, навигация для незрячих пользователей — все эти сценарии страдают, когда сигнал нужно дробить между тремя-четырьмя независимыми подсистемами. Чем больше стыков, тем выше задержка, тем больше потеря контекста и тем слабее ощущение непрерывного диалога.

Не менее важен экономический слой. Даже сильная архитектурная идея мало что меняет, если она слишком дорогая. Поэтому связка «ниже задержка + ниже цена API» в случае GPT-4o важнее, чем она может показаться на фоне обычных бенчмарков: именно такая комбинация делает мультимодальность операционно правдоподобной.

Но у этого сдвига есть оборотная сторона. Если текстовая модель в основном рискует галлюцинациями и небезопасными инструкциями, то omni-модель получает новые классы проблем: распознавание личности по голосу, ложные выводы о настроении и намерениях человека, чрезмерная антропоморфизация, эмоциональная зависимость от голосового режима, более реалистичная имитация поведения собеседника. В этом смысле GPT-4o — не просто «ещё одна модель», а расширение поверхности безопасности.

Ограничения и критика

  • Публичных технических деталей недостаточно. У GPT-4o нет полноценного технического отчёта уровня «вот размер модели, вот training compute, вот схема модального слияния». Есть анонс, System Card и продуктовые страницы. Для понимания идеи этого достаточно, для глубокой реконструкции архитектуры — нет.
  • Запуск был поэтапным. Поэтому нельзя читать слово omni как «все заявленные модальности были одинаково доступны всем пользователям уже 13 мая 2024 года». Источники сами показывают более осторожную картину.
  • Часть evidence остаётся внутренней. METR и Apollo Research добавили полезный внешний слой проверки, но значительная часть оценки всё равно организована OpenAI и зависит от её собственной рамки Preparedness.
  • Даже положительные multilingual-результаты не универсальны. System Card показывает сильные прибавки на ряде языков и задач, но одновременно подчёркивает, что покрытие неполное и что английский по-прежнему остаётся более сильной точкой.
  • Medium risk — это не «нулевой риск». По собственной рамке OpenAI GPT-4o в целом классифицирована как модель уровня Medium, прежде всего из-за persuasion. Это ограниченное и процедурное утверждение, а не глобальный знак безопасности.
  • Свежесть знаний ограничена октябрём 2023 года. Для приложений, где критична актуальность фактов, архитектурный прогресс сам по себе не решает проблему.

Вывод

Если убрать шум вокруг бренда, GPT-4o важна по довольно приземлённой причине: OpenAI попыталась сделать мультимодальность не набором пристроек к текстовой LLM, а единым вычислительным контуром. Именно это и скрывается за словом omni.

По состоянию на источники от 13 мая и 8 августа 2024 года GPT-4o — это не доказательство того, что проблема мультимодального ИИ уже решена. Но это убедительный признак смены инженерного направления: от пайплайнов из отдельных моделей к одной модели, которая слышит, видит и отвечает в общем контексте.

Источники

  • Hello GPT-4o | OpenAI — первичный анонс от 13 мая 2024 года: определение omni, end-to-end обучение, голосовая задержка и ценовые тезисы запуска.
  • Introducing GPT-4o and more tools to ChatGPT free users | OpenAI — второй официальный материал того же дня, полезный для проверки дат и границ первоначального продуктового развёртывания.
  • GPT-4o System Card | OpenAI — основная страница с описанием архитектуры, рисков, red teaming и оценок Preparedness.
  • GPT-4o System Card (PDF) | OpenAI — PDF-версия карты системы с числовыми деталями, таблицами и разделом о сторонних оценках.
  • GPT-4o Model | OpenAI API — текущая карточка модели в каталоге API; полезна для подтверждения knowledge cutoff и исторических снапшотов.
  • Preparedness Framework (Beta) | OpenAI — рамка, по которой OpenAI объясняет пороги развёртывания и frontier-risk scorecard.
  • GPT-4V(ision) system card | OpenAI — важный контекст для сравнения с предыдущим этапом мультимодальности OpenAI.
  • GPT-4 | OpenAI — исторический базовый материал по GPT-4 как предыдущему поколению модели.
  • Details about METR’s preliminary evaluation of GPT-4o | METR — внешняя предварительная оценка агентных и автономных способностей GPT-4o, включая ограничения методологии.
  • Universals and cultural variation in turn-taking in conversation | Proceedings of the National Academy of Sciences — академический источник, на который OpenAI ссылается, сравнивая задержку голосового ответа GPT-4o с человеческим turn-taking.

FAQ

GPT-4o — это просто GPT-4 с голосом?

Нет. По материалам OpenAI разница не сводится к новому интерфейсу. Ключевой тезис в том, что GPT-4o обучена end-to-end на тексте, зрении и аудио как единая модель, а не работает как цепочка из распознавания речи, текстовой модели и синтеза речи.

Почему OpenAI использует слово omni, а не просто multimodal?

Потому что акцент сделан не на списке поддерживаемых форматов, а на единой модели, которая принимает смешанный ввод и генерирует смешанный вывод. Иначе говоря, omni здесь — это архитектурное утверждение, а не только UI-ярлык.

Были ли все возможности GPT-4o доступны сразу после анонса?

Нет. В материалах от 13 мая 2024 года OpenAI сама пишет о поэтапном развёртывании. Это важное ограничение: архитектурная идея была шире, чем публично доступный набор функций в день запуска.

Что остаётся самым слабым местом публичного описания GPT-4o?

Недостаток технической конкретики. System Card полезна для понимания рисков и high-level устройства, но не заменяет полноценный технический отчёт с параметрами архитектуры и обучения.

Читайте также