
На сайте cliphou.se опубликован LLM Motion Graphics Benchmark — публичный тест, который замеряет, насколько хорошо современные языковые модели генерируют код для анимированной графики. Бенчмарк сфокусирован не на прямой генерации видео нейросетями, а на написании полноценного кода композиции с последующим рендерингом через Remotion. Разработчики получают готовые, редактируемые прямо в браузере видео и объективную картину соотношения цены запроса, времени выполнения и способности модели довести результат до работающего ролика.
ЗАЧЕМ НУЖЕН ТАКОЙ ТЕСТ
Запуск теста стал реакцией на растущее качество агентов, генерирующих моушн-дизайн. Создателям важно понимать, насколько велик разрыв между флагманской Opus 5.5 и более дешёвыми альтернативами, и можно ли в принципе получить приемлемый видеоролик без переплаты за топовые эндпоинты. В отличие от традиционных бенчмарков кода, здесь модель обязана не только написать корректный TypeScript/TSX, но и соблюсти художественный бриф: сценарий, тайминг, палитру, шрифты и поведение интерфейсных элементов.
МЕТОДОЛОГИЯ ИСПЫТАНИЙ
Все запросы отправляются через OpenRouter с лимитом в 32 000 токенов (включая результирующие рассуждения у reasoning-моделей). Каждая модель получает один и тот же фиксированный бриф на 12-секундный рекламный ролик вымышленного приложения «Relay». Генерация должна вернуть готовую композицию Remotion для разрешения 1920×1080, 30 fps, без внешних ресурсов, аудио и дополнительных утверждений. Используются локально установленные шрифты и цветовая палитра, обзор интернета отключён.
На трёх неизменных брифингах делается по два независимых запуска, а успешной считается только компиляция кода без ошибок и его последующая отрисовка в видео. Если первая попытка проваливается, модель получает ровно одну автоматическую попытку восстановления с передачей лога ошибок. Восстановление увеличивает итоговую стоимость, которая прозрачно разбивается на оригинальные запросы и цену ремонта. Такой подход позволяет оценить не только идеальную генерацию, но и реальную «живучесть» модели при неизбежных ошибках.
ЧТО ПОПАЛО В ПОДБОРКУ
Результаты сгруппированы по ценовым категориям и не являются рейтингом популярности — это сознательно составленная подборка, охватывающая как дорогие фронтальные модели, так и откровенно бюджетные эндпоинты. Для каждого участника указано время успешной генерации по данным OpenRouter (момент, когда API вернул код, приведший к корректному рендеру), полная стоимость с учётом ремонта и сам исходный код композиции. Все видео можно отредактировать на месте, а сами файлы запусков выложены открыто.
ВЫВОДЫ ДЛЯ ПРАКТИКОВ
Бенчмарк ожидаемо показывает, что более дорогие модели чаще справляются с первой попытки и выдают композиции высокого визуального качества. Однако детальный разбор восстановленных вариантов даёт неожиданный практический инсайт: при допуске автоматического ремонта некоторые среднебюджетные и даже дешёвые модели способны дотягивать результат до приемлемого уровня, иногда радикально выигрывая по итоговой стоимости. Это делает осмысленной стратегию «дешёвая модель плюс контролируемое восстановление» для прототипирования моушн-дизайна, где допустимо один-два цикла правок.
Для инженеров Cliphouse превращается в площадку, где можно быстро протестировать конкретную модель перед интеграцией в пайплайн, не тратя лишние деньги на эксперименты. Рендеринг выполняется локально после получения кода, поэтому затраты облачных GPU минимальны — основная статья расходов остаётся за самим LLM-запросом.
Источники
1. LLM Motion Graphics Benchmark — https://cliphou.se/benchmark/
2. Публикация на Hacker News — https://news.ycombinator.com/item?id=50011813
3. Проверочная ссылка comrad404 — https://comrad404.com/pulse/










