
Cloudflare представила Clef-omni — новую модель из семейства Clef для принятия структурированных решений по нескольким типам данных. По заявлению компании, модель принимает текст, изображения, аудио и видео в одном запросе. Одновременно Cloudflare сообщила об ускорении базовой Clef и снижении стоимости Clef-flash.
Релиз опубликован 9 октября 2026 года, вскоре после запуска первых моделей семейства. Clef-omni ориентирована прежде всего на разработчиков, которым приходится объединять результаты распознавания речи, анализа изображений и обработки видео перед передачей их в систему классификации или маршрутизации.
Один запрос вместо цепочки мультимодальных сервисов
Clef-omni поддерживает аудио в форматах WAV и MP3, видео в MP4 и WebM, а также изображения и текст. Cloudflare предлагает использовать модель в сценариях, где итоговое решение зависит от нескольких источников одновременно.
В качестве примера компания приводит проверку оборудования. Приложение может передать фотографию устройства, аудиозапись его работы и видеозапись вентилятора, а затем задать структурированные вопросы: видны ли модель и серийный номер, есть ли посторонние звуки и вращается ли вентилятор.
Ответом в таком сценарии становятся значения заданных полей, а не обязательно свободное текстовое описание файлов. Для разработчика это означает возможность сразу определить допустимые варианты — например, «да», «нет» или «неопределённо» — и использовать результат в автоматизации.
Раньше подобный процесс обычно требовал нескольких компонентов: отдельного распознавания речи, анализа изображения или кадров видео, а затем объединения результатов в одном классификаторе. Cloudflare позиционирует Clef-omni как способ сократить такую цепочку до одного API-вызова. Это не отменяет необходимости проверять качество каждого типа входных данных: единая точка вызова не гарантирует, что модель одинаково хорошо распознаёт шумное аудио, плохо освещённое видео и противоречивые сигналы.
Что Cloudflare сообщает об архитектуре
Согласно описанию разработчика, Clef-omni построена на основе Qwen3-Omni-30B-A3B-Instruct — мультимодальной архитектуры с mixture of experts. Cloudflare использует её способности к обработке текста, изображений, аудио и видео, но исключает компоненты, связанные с генерацией речи.
Семейство Clef предназначено не для создания длинных ответов, а для оценки допустимых вариантов в заданной схеме. Поэтому входные данные используются для расчёта уверенности по полям и вариантам ответа. Компания заявляет, что модель обрабатывает мультимодальный контекст совместно, синхронизируя аудио, видео и визуальные кадры.
Cloudflare также упоминает обучение с LoRA-адаптерами и последующую калибровку результатов. Эти сведения описывают заявленный подход к созданию модели, но сами по себе не подтверждают её качество в независимых условиях. Разработчикам по-прежнему придётся проверять, как Clef-omni работает на их данных, языках, форматах файлов и схемах ответов.
Веса модели, по словам Cloudflare, опубликованы на Hugging Face. Использование открытых весов и работа через облачный API — разные сценарии: перед развёртыванием нужно отдельно проверить требования к оборудованию, доступные лицензии и актуальные инструкции разработчика.
Заявленные задержки и результаты тестов
Cloudflare приводит следующие ориентиры времени обработки: около 130 мс для текстовых запросов, около 150 мс для изображений и несколько сотен миллисекунд для аудио. Видео длительностью 21 секунду со звуком, по утверждению компании, обрабатывается примерно за 1,5 секунды в одном API-вызове.
Это показатели из материала самого разработчика модели. В публикации не приведена независимая методика, которая позволила бы сопоставить их с задержкой в конкретном приложении. На итоговое время могут влиять размер медиафайлов, пропускная способность сети, нагрузка на сервис, параметры запроса и способ загрузки данных.
Cloudflare также сравнила Clef-omni с Clef, Clef-flash и моделью Jev в нескольких наборах тестов. В BFCL показатель case exact для Clef-omni составил 98,2, тогда как для Clef указан результат 98,47, а для Clef-flash — 98,76. В CLINC150+OOS Cloudflare приводит для Clef-omni macro-F1 на уровне 97,7 против 97,43 у Clef.
Результаты неоднородны и не показывают безусловного превосходства новой модели. В отдельных сценариях Clef-omni уступает другим версиям семейства, а опубликованные тесты не заменяют проверку на данных конкретного проекта. Особенно осторожно следует трактовать оценки для видео и аудио: их качество может заметно зависеть от шума, длительности записи, качества изображения и содержания инструкций.
Подробное описание релиза опубликовано в блоге Cloudflare: https://blog.cloudflare.com/clef-faster-cheaper-multimodal/. Для проверки способов подключения разработчикам следует использовать документацию Workers AI: https://developers.cloudflare.com/workers-ai/. Поиск доступных версий и весов модели размещён на Hugging Face: https://huggingface.co/models?search=clef-omni.
Что изменилось в Clef и Clef-flash
Помимо Clef-omni, Cloudflare заявила об ускорении модели Clef. В кратком описании релиза говорится о приросте скорости до 2,0 раза. Это максимальный заявленный показатель, а не универсальная гарантия для каждого запроса: без точных условий сравнения его нельзя напрямую переносить на конкретную нагрузку.
Для Clef-flash компания сообщила о снижении цены и заявила, что модель стала дешевле Jev. В доступном описании нет полной таблицы тарифов, единиц тарификации и расчёта стоимости на одинаковом объёме запросов. Поэтому экономию необходимо проверять по актуальному прайс-листу и собственному профилю нагрузки.
Перед внедрением Clef-omni разумно собрать контрольный набор реальных примеров: фотографии, аудиозаписи и видео, для которых заранее известен правильный результат. Отдельно стоит проверить шум, плохое освещение, несколько объектов в кадре, несовпадающие аудио- и визуальные признаки, а также ответы при недостатке данных. Для решений с высокой ценой ошибки следует предусмотреть вариант «не уверен» и ручную проверку.
Заявления о скорости, качестве тестов и снижении стоимости исходят от Cloudflare. В предоставленных материалах нет независимой проверки этих показателей, поэтому перед миграцией стоит сравнить Clef-omni с используемой моделью на одинаковых данных, критериях качества и реальной стоимости одного рабочего сценария.










