
Пользователь Reddit под ником Purple-Low-2779 в сообществе r/artificial обратил внимание на растущую тенденцию: видеогенераторы (например, FLUX 3 от Black Forest Labs, Runway Gen-4.5, Luma Ray 3.2) всё чаще называют «мировыми моделями», хотя их фактическое тестирование ограничивается preference-тестами — сравнениями, где зрители выбирают более «красивый» или «реалистичный» клип за несколько секунд.
Что произошло?
Автор указывает, что термин «мировая модель» ранее означал систему, которая представляет, как объекты взаимодействуют в пространстве и времени. Сейчас же он используется как маркетинговый ярлык для любого генератора видео. В качестве примера приводится недавний запуск FLUX 3, где Black Forest Labs опубликовала результат: «77% предпочтений против Runway Gen-4.5, 93% против Luma Ray 3.2». Однако в мелком шрифте указано, что это предварительная оценка раннего кандидата в ходе обучения, без методологии, размера выборки, состава оценщиков и набора промптов.
Почему это вызывает споры?
Preference-тесты не воспроизводимы. Если через три месяца кто-то захочет проверить, улучшилась ли модель, повторить тест невозможно — нет фиксированных стимулов и процедур. В отличие от публичных бенчмарков, которые можно перезапустить с другими промптами и получить аргументированный спор, preference-тест остаётся «чёрным ящиком». Автор подчёркивает, что такие тесты измеряют вкус, а не физическое понимание. Никто не может проверить, знает ли модель, что произойдёт, если сдвинуть стакан со стола.
Что подтверждено, а что нет?
Подтверждено, что Black Forest Labs действительно опубликовала заявление с указанными цифрами. Подтверждено, что в посте указаны оговорки о предварительном характере. Однако независимая проверка этих цифр отсутствует. Неясно, насколько выборка была репрезентативной и как она соотносится с реальным физическим моделированием.
Что можно проверить далее?
Стоит следить за появлением независимых бенчмарков для видеомоделей, которые проверяют физическую согласованность (например, задач с объектами, взаимодействиями, причинно-следственными связями). Также можно посмотреть ответы Black Forest Labs и других компаний на эту критику.
| Punkt | Detail |
|---|---|
| Источник | Reddit r/artificial, пост пользователя Purple-Low-2779 |
| Основная претензия | Preference-тесты не доказывают, что модель понимает физику мира |
| Пример | FLUX 3 от Black Forest Labs: 77% против Gen-4.5, 93% против Ray 3.2 |
| Проблема | Невоспроизводимость, отсутствие методологии, подмена понятий |
| Статус | Обсуждение, независимых подтверждений нет |
Источники
Оригинальное обсуждение: https://www.reddit.com/r/artificial/comments/1v7yltm/we_started_calling_video_models_world_models/
Страница проверки: https://comrad404.com/pulse/