
Что произошло
В свежем препринте arXiv (cs.LG) предложен PRISM — четырёхэтапный фреймворк синтеза данных для обучения мультимодальных LLM исполнению многошаговых рубрик. Авторы исходят из разрыва: реальные инструкции обычно содержат несколько требований разной важности, а большинство обучающих данных сводит задачу к одному самодостаточному вопросу.
Почему это обсуждают
Вместо подхода «модель как генератор, оцениваемый по рубрикам» авторы предлагают режим «модель как исполнитель»: на вход подаётся изображение и типизированная рубрика с приоритетами, модель должна проверить каждое правило перед итоговым суждением. Это смещает фокус с генерации на проверку условий, что ближе к реальным сценариям агентов и автоматизации.
Что подтверждено
PRISM-Eval использует детерминированное сопоставление с фиксированными метками (Loose и Strict) и не требует judge-модели в инференсе. На 10K синтезированных примерах Qwen3-VL-4B вырос с 9,5% до 30,1% по строгой метрике, без падения средних результатов на общих бенчмарках. Эффект переносится на четыре другие открытые MLLM, включая плотные и MoE-архитектуры.
Что остаётся неясным
Препринт пока не прошёл полноценную внешнюю проверку; детали генерации данных, фильтрации качества и состав PRISM-Eval требуют изучения исходного текста. Нужно также оценить, насколько метод масштабируется за пределами 10K примеров и сохраняется ли эффект на более сильных базовых моделях.
Таблица ключевых пунктов:
| Punkt | Detail |
|---|---|
| Метод | Четырёхэтапный синтез: пары «персона—задача», префиксные наборы правил, отфильтрованные рубрики, трассы верификации |
| Данные | 10K синтезированных примеров |
| Бенчмарк | PRISM-Eval, метрики Loose и Strict, без judge-модели |
| Результат | Qwen3-VL-4B: 9,5% → 30,1% Strict; перенос на 4 MLLM |
Источники:
Оригинал: https://arxiv.org/abs/2608.05249
Проверка: https://arxiv.org/
