Запись архива

Почему preference-тесты видео-моделей не доказывают, что они «мировые модели»: обсуждение на Reddit

Пользователь Reddit в r/artificial критикует практику называть видеогенераторы «мировыми моделями» на основе внутренних preference-тестов, которые не поддаются воспроизведению и не измеряют физическое понимание.

Скриншот обсуждения на Reddit о проблемах оценки видеомоделей
Скриншот обсуждения на Reddit о проблемах оценки видеомоделей
Journalists Protest against rising violence during march in Mexi | by Knight Foundation | openverse | by-sa

Пользователь Reddit под ником Purple-Low-2779 в сообществе r/artificial обратил внимание на растущую тенденцию: видеогенераторы (например, FLUX 3 от Black Forest Labs, Runway Gen-4.5, Luma Ray 3.2) всё чаще называют «мировыми моделями», хотя их фактическое тестирование ограничивается preference-тестами — сравнениями, где зрители выбирают более «красивый» или «реалистичный» клип за несколько секунд.

Что произошло?
Автор указывает, что термин «мировая модель» ранее означал систему, которая представляет, как объекты взаимодействуют в пространстве и времени. Сейчас же он используется как маркетинговый ярлык для любого генератора видео. В качестве примера приводится недавний запуск FLUX 3, где Black Forest Labs опубликовала результат: «77% предпочтений против Runway Gen-4.5, 93% против Luma Ray 3.2». Однако в мелком шрифте указано, что это предварительная оценка раннего кандидата в ходе обучения, без методологии, размера выборки, состава оценщиков и набора промптов.

Почему это вызывает споры?
Preference-тесты не воспроизводимы. Если через три месяца кто-то захочет проверить, улучшилась ли модель, повторить тест невозможно — нет фиксированных стимулов и процедур. В отличие от публичных бенчмарков, которые можно перезапустить с другими промптами и получить аргументированный спор, preference-тест остаётся «чёрным ящиком». Автор подчёркивает, что такие тесты измеряют вкус, а не физическое понимание. Никто не может проверить, знает ли модель, что произойдёт, если сдвинуть стакан со стола.

Что подтверждено, а что нет?
Подтверждено, что Black Forest Labs действительно опубликовала заявление с указанными цифрами. Подтверждено, что в посте указаны оговорки о предварительном характере. Однако независимая проверка этих цифр отсутствует. Неясно, насколько выборка была репрезентативной и как она соотносится с реальным физическим моделированием.

Что можно проверить далее?
Стоит следить за появлением независимых бенчмарков для видеомоделей, которые проверяют физическую согласованность (например, задач с объектами, взаимодействиями, причинно-следственными связями). Также можно посмотреть ответы Black Forest Labs и других компаний на эту критику.

Punkt Detail
Источник Reddit r/artificial, пост пользователя Purple-Low-2779
Основная претензия Preference-тесты не доказывают, что модель понимает физику мира
Пример FLUX 3 от Black Forest Labs: 77% против Gen-4.5, 93% против Ray 3.2
Проблема Невоспроизводимость, отсутствие методологии, подмена понятий
Статус Обсуждение, независимых подтверждений нет

Источники
Оригинальное обсуждение: https://www.reddit.com/r/artificial/comments/1v7yltm/we_started_calling_video_models_world_models/
Страница проверки: https://comrad404.com/pulse/