Мультимодальная модель (multimodal model) — это модель, которая принимает или объединяет больше одной модальности данных: например, текст, изображение, аудио или видео. Она может возвращать один поддерживаемый тип ответа или несколько, в зависимости от конкретной модели и точки доступа: например, в техническом отчёте GPT-4 описан как large multimodal model с входами «изображение + текст» и текстовым выходом, а в system card GPT-4o описан как omni model, принимающий комбинации текста, аудио, изображений и видео и генерирующий комбинации текста, аудио и изображений.
Английский термин: multimodal model. Также встречается: «мультимодальная ИИ-модель». Термин «омни-модель» используется не как полный синоним, а как продуктовая формулировка для отдельных линеек, например GPT-4o.
Ниже — состояние по официальным документам, проверенным на 2026-08-13. Важная оговорка: поставщики обычно подробно описывают поддерживаемые входы, выходы и ограничения, но далеко не всегда раскрывают внутреннюю архитектуру. Поэтому блок «Как это работает» ниже объясняет принцип на уровне поведения модели, а не конкретных слоёв и механизмов слияния сигналов.
Простыми словами
Грубо говоря, мультимодальная модель — это не «бот, который читает только текст», а система, которой можно дать разные виды данных в одном запросе. Вы показываете изображение, добавляете текстовую инструкцию, а модель отвечает в том формате, который поддерживает.
Можно представить это как помощника, который одновременно смотрит на картинку, читает подпись к ней и учитывает ваш вопрос. Если модель более узкая, она, как GPT-4 из технического отчёта, может понимать картинку, но отвечать только текстом. Если модель шире по возможностям, как GPT-4o в system card, список допустимых входов и выходов больше.
Как это работает
На практике мультимодальность означает, что в одном обращении участвуют разные типы входа. Общий принцип по документации разных поставщиков выглядит так:
Текст / изображение / аудио / видео
↓
один запрос к модели
↓
модель сопоставляет сигналы из разных модальностей
↓
формирует ответ в поддерживаемой модальности
↓
текст / аудио / изображение / векторное представление
- Вы подаёте данные. Это может быть текст и изображение, как у GPT-4 в описанном варианте из technical report, или более широкая комбинация модальностей, как у GPT-4o в system card.
- Модель обрабатывает вход как единый контекст. Для пользователя это выглядит как один запрос, а не как отдельные независимые вызовы «сначала OCR, потом чат».
- Ответ зависит от конкретной модели и endpoint. В одних документах заявлено понимание изображений с текстовым ответом, в других — комбинации текста, аудио, изображений и видео на входе и текста, аудио, изображений на выходе.
- Иногда результатом является не ответ для человека, а вектор. Google описывает Gemini Embedding 2 как multimodal embedding model, который отображает текст, изображения, видео, аудио и PDF в единое embedding space.
Это ключевой момент: «мультимодальная» не означает автоматически «генерирует всё подряд». Термин говорит прежде всего о том, что модель умеет работать более чем с одной модальностью данных.
Где применяется
- Анализ изображения по текстовой инструкции. GPT-4 в техническом отчёте и vision-возможности Claude в официальной документации показывают типичный сценарий: вы передаёте картинку и текстовый вопрос, а модель объясняет содержимое, находит нужные элементы или помогает с задачей по изображению.
- Смешанные ассистенты. GPT-4o system card описывает модель, работающую с комбинациями текста, аудио, изображений и видео. Это типичный класс интерфейсов, где пользователь не ограничен только клавиатурой.
- Поиск и retrieval по разным типам данных. Google указывает, что Gemini Embedding 2 — это мультимодальная embedding model для текста, изображений, видео, аудио и PDF. Такой тип моделей полезен не для генерации ответа сам по себе, а для поиска похожих объектов и мультимодального RAG.
- Текст, код и изображения в одном рабочем потоке. Anthropic пишет, что Claude помогает в задачах с текстом, кодом и изображениями, а отдельная vision-документация описывает поддерживаемые форматы и ограничения для таких сценариев.
Практический пример
Самый понятный сценарий — извлечение структуры из изображения документа. Ниже не привязка к одной конкретной платформе, а шаблон запроса, который показывает саму идею мультимодальности: изображение и текстовая инструкция передаются вместе.
Вход:
1) Изображение чека или счета
2) Инструкция:
«Извлеки поля: дата, номер документа, итоговая сумма.
Если поле неразборчиво, верни null.
Ответ дай в виде JSON»
Ожидаемый тип ответа:
{
"date": "...",
"document_number": "...",
"total": "..."
}
Почему это именно мультимодальный сценарий:
- изображение несёт визуальные данные;
- текст задаёт задачу и формат ответа;
- модель должна совместить оба сигнала и выдать структурированный результат.
Практическая оговорка: форматы файлов, размеры запросов и поведение по платформам различаются. Например, в vision guide для Claude отдельно указаны JPEG, PNG, GIF и WebP, а также ограничения размера запроса и платформенные ограничения. Перед интеграцией такие детали нужно проверять в документации конкретного endpoint.
Чем отличается от…
| Термин | В чём отличие | Пример из источников |
|---|---|---|
| Модель «изображение + текст → текст» | Это более узкий случай мультимодальности: входов несколько, но выход только текстовый. | GPT-4 в technical report принимает изображение и текст, а выдаёт текст. |
| Омни-модель | Это не общий научный термин для всех мультимодальных систем, а продуктовая формулировка для модели с более широким набором модальностей. | GPT-4o system card описывает combinations of text, audio, image, and video на входе и text, audio, and image на выходе. |
| Мультимодальная embedding model | Такая модель не обязана генерировать текст, аудио или изображение для пользователя. Она может возвращать векторные представления для поиска и retrieval. | Google описывает Gemini Embedding 2 как модель, которая отображает text, images, video, audio и PDFs в unified embedding space. |
Если вам нужно разобраться в соседних понятиях, полезно также посмотреть статьи «Генеративная модель (Generative Model)» и «Большая языковая модель (LLM)»: они отвечают на другие вопросы о типе модели, а не только о модальностях.
Ограничения и заблуждения
- Заблуждение: «мультимодальная» значит «умеет всё». Нет. Один поставщик может иметь несколько моделей с разным набором модальностей. Даже внутри одной линейки различия заметны: GPT-4 в technical report и GPT-4o в system card описаны по-разному.
- Заблуждение: возможности одинаковы везде. В source pack отдельно отмечено, что одна и та же линейка может по-разному вести себя в API, потребительском продукте и партнёрском облаке. Для OpenAI это видно уже по разнице между system card GPT-4o и текущей API-страницей модели GPT-4o.
- Ограничение: форматы и размеры входа жёстко ограничены. Для Claude vision официально задокументированы поддерживаемые форматы изображений и платформенные ограничения. Аналогичную проверку стоит делать у любого поставщика до продакшена.
- Ограничение: региональная доступность не универсальна. OpenAI отдельно указывает, что API доступен только в поддерживаемых странах и территориях. Это нужно проверять до запуска интеграции.
- Ограничение: цены, rate limits и кеширование меняются. В официальных материалах OpenAI по prompt caching сказано, что кеширование автоматически применяется на latest versions of GPT-4o, а тарифные условия могут меняться. У Google и Anthropic pricing тоже нужно сверять на текущих страницах перед расчётом экономики.
Практический вывод. Если вы выбираете мультимодальную модель для реальной задачи, проверяйте не абстрактную метку «multimodal», а три конкретные вещи: какие модальности поддерживаются именно в вашем endpoint, какие есть лимиты на форматы и размер входа, и доступна ли функция в вашем регионе и тарифе.
Редакционное ограничение: этот материал опирается на официальные документы и системные карточки, где хорошо описаны доступные входы, выходы и ограничения, но слабо раскрыта внутренняя архитектура. Поэтому статья помогает выбрать и корректно трактовать термин, но не заменяет архитектурный разбор конкретной модели.
Связанные термины и материалы
- Модель в ML — базовый контекст, если вы хотите отличать класс модели от конкретного продукта.
- Диффузионная модель — полезно, если вас интересует генерация изображений как частный случай, а не сама мультимодальность.
- Локальная модель vs облачный API: что выбрать для продакшена — пригодится при выборе способа внедрения мультимодального стека.
- Как файн-тюнить модель: с чего начать — следующий шаг, если вы уже выбрали базовую модель и хотите адаптировать её под свой кейс.
Источники
- GPT-4 Technical Report
- GPT-4o System Card
- GPT-4o model page
- Prompt caching for the API
- OpenAI API supported countries and territories
- Default usage policies by endpoint
- Gemini API models
- Gemini API changelog
- Claude docs introduction
- Claude vision guide
Вопросы и ответы
Мультимодальная модель — это обязательно генерация изображений и аудио?
Нет. По техническому отчёту GPT-4 мультимодальность уже есть в варианте «изображение + текст на входе, текст на выходе». Более широкие комбинации модальностей зависят от конкретной модели: GPT-4o system card описывает более широкий набор входов и выходов.
Любая мультимодальная модель умеет работать с видео?
Нет. Набор модальностей нужно проверять по странице конкретной модели и конкретного endpoint. В source pack прямо отмечено, что capability is model- and endpoint-specific.
Мультимодальная модель и мультимодальная embedding model — это одно и то же?
Нет. Google описывает Gemini Embedding 2 как модель, которая переводит текст, изображения, видео, аудио и PDF в единое embedding space. Это полезно для поиска и retrieval, но не то же самое, что пользовательская генерация текста, аудио или изображения.
Что проверить перед продакшен-интеграцией?
Минимум четыре пункта: поддерживаемые модальности именно в вашем endpoint, ограничения на форматы и размер данных, региональную доступность и актуальные цены/лимиты. Для OpenAI, Google и Anthropic эти условия задокументированы на официальных страницах и могут обновляться.