Запись архива

PRISM: как научить мультимодальные модели исполнять приоритизированные инструкции

PRISM — четырёхэтапный синтез данных для обучения мультимодальных LLM следовать многошаговым рубрикам. На 10K примерах Qwen3-VL-4B вырос с 9,5% до 30,1% по строгой метрике PRISM-Eval без потери качества на общих бенчмарках.

Абстрактная иллюстрация: проверка списка правил с приоритетами при обработке изображения
Абстрактная иллюстрация: проверка списка правил с приоритетами при обработке изображения
Gemini multimodal AI.png | by Authors of the preprint: Gemini Team Google: Rohan Anil, Sebastian Borgeaud, Yonghui Wu, Jean-Baptiste Alayrac, Jiahui Y | wikimedia_commons | CC BY 4.0

Что произошло

В свежем препринте arXiv (cs.LG) предложен PRISM — четырёхэтапный фреймворк синтеза данных для обучения мультимодальных LLM исполнению многошаговых рубрик. Авторы исходят из разрыва: реальные инструкции обычно содержат несколько требований разной важности, а большинство обучающих данных сводит задачу к одному самодостаточному вопросу.

Почему это обсуждают

Вместо подхода «модель как генератор, оцениваемый по рубрикам» авторы предлагают режим «модель как исполнитель»: на вход подаётся изображение и типизированная рубрика с приоритетами, модель должна проверить каждое правило перед итоговым суждением. Это смещает фокус с генерации на проверку условий, что ближе к реальным сценариям агентов и автоматизации.

Что подтверждено

PRISM-Eval использует детерминированное сопоставление с фиксированными метками (Loose и Strict) и не требует judge-модели в инференсе. На 10K синтезированных примерах Qwen3-VL-4B вырос с 9,5% до 30,1% по строгой метрике, без падения средних результатов на общих бенчмарках. Эффект переносится на четыре другие открытые MLLM, включая плотные и MoE-архитектуры.

Что остаётся неясным

Препринт пока не прошёл полноценную внешнюю проверку; детали генерации данных, фильтрации качества и состав PRISM-Eval требуют изучения исходного текста. Нужно также оценить, насколько метод масштабируется за пределами 10K примеров и сохраняется ли эффект на более сильных базовых моделях.

Таблица ключевых пунктов:

Punkt Detail
Метод Четырёхэтапный синтез: пары «персона—задача», префиксные наборы правил, отфильтрованные рубрики, трассы верификации
Данные 10K синтезированных примеров
Бенчмарк PRISM-Eval, метрики Loose и Strict, без judge-модели
Результат Qwen3-VL-4B: 9,5% → 30,1% Strict; перенос на 4 MLLM

Источники:

Оригинал: https://arxiv.org/abs/2608.05249
Проверка: https://arxiv.org/