Бенчмарк LLM Motion Graphics Benchmark: генерация моушн-дизайна языковыми моделями

На Cliphouse запущен тест, сравнивающий способность больших языковых моделей создавать код для анимированной графики. Бенчмарк проверяет стоимость, время и надёжность генерации рекламных роликов на примере простого брифа — с автоматическим восстановлением после ошибок.

Интерфейс бенчмарка LLM Motion Graphics Benchmark на сайте cliphou.se
Интерфейс бенчмарка LLM Motion Graphics Benchmark на сайте cliphou.se
Изображение из исходного материала

На сайте cliphou.se опубликован LLM Motion Graphics Benchmark — публичный тест, который замеряет, насколько хорошо современные языковые модели генерируют код для анимированной графики. Бенчмарк сфокусирован не на прямой генерации видео нейросетями, а на написании полноценного кода композиции с последующим рендерингом через Remotion. Разработчики получают готовые, редактируемые прямо в браузере видео и объективную картину соотношения цены запроса, времени выполнения и способности модели довести результат до работающего ролика.

ЗАЧЕМ НУЖЕН ТАКОЙ ТЕСТ
Запуск теста стал реакцией на растущее качество агентов, генерирующих моушн-дизайн. Создателям важно понимать, насколько велик разрыв между флагманской Opus 5.5 и более дешёвыми альтернативами, и можно ли в принципе получить приемлемый видеоролик без переплаты за топовые эндпоинты. В отличие от традиционных бенчмарков кода, здесь модель обязана не только написать корректный TypeScript/TSX, но и соблюсти художественный бриф: сценарий, тайминг, палитру, шрифты и поведение интерфейсных элементов.

МЕТОДОЛОГИЯ ИСПЫТАНИЙ
Все запросы отправляются через OpenRouter с лимитом в 32 000 токенов (включая результирующие рассуждения у reasoning-моделей). Каждая модель получает один и тот же фиксированный бриф на 12-секундный рекламный ролик вымышленного приложения «Relay». Генерация должна вернуть готовую композицию Remotion для разрешения 1920×1080, 30 fps, без внешних ресурсов, аудио и дополнительных утверждений. Используются локально установленные шрифты и цветовая палитра, обзор интернета отключён.

На трёх неизменных брифингах делается по два независимых запуска, а успешной считается только компиляция кода без ошибок и его последующая отрисовка в видео. Если первая попытка проваливается, модель получает ровно одну автоматическую попытку восстановления с передачей лога ошибок. Восстановление увеличивает итоговую стоимость, которая прозрачно разбивается на оригинальные запросы и цену ремонта. Такой подход позволяет оценить не только идеальную генерацию, но и реальную «живучесть» модели при неизбежных ошибках.

ЧТО ПОПАЛО В ПОДБОРКУ
Результаты сгруппированы по ценовым категориям и не являются рейтингом популярности — это сознательно составленная подборка, охватывающая как дорогие фронтальные модели, так и откровенно бюджетные эндпоинты. Для каждого участника указано время успешной генерации по данным OpenRouter (момент, когда API вернул код, приведший к корректному рендеру), полная стоимость с учётом ремонта и сам исходный код композиции. Все видео можно отредактировать на месте, а сами файлы запусков выложены открыто.

ВЫВОДЫ ДЛЯ ПРАКТИКОВ
Бенчмарк ожидаемо показывает, что более дорогие модели чаще справляются с первой попытки и выдают композиции высокого визуального качества. Однако детальный разбор восстановленных вариантов даёт неожиданный практический инсайт: при допуске автоматического ремонта некоторые среднебюджетные и даже дешёвые модели способны дотягивать результат до приемлемого уровня, иногда радикально выигрывая по итоговой стоимости. Это делает осмысленной стратегию «дешёвая модель плюс контролируемое восстановление» для прототипирования моушн-дизайна, где допустимо один-два цикла правок.

Для инженеров Cliphouse превращается в площадку, где можно быстро протестировать конкретную модель перед интеграцией в пайплайн, не тратя лишние деньги на эксперименты. Рендеринг выполняется локально после получения кода, поэтому затраты облачных GPU минимальны — основная статья расходов остаётся за самим LLM-запросом.

Источники
1. LLM Motion Graphics Benchmark — https://cliphou.se/benchmark/
2. Публикация на Hacker News — https://news.ycombinator.com/item?id=50011813
3. Проверочная ссылка comrad404 — https://comrad404.com/pulse/