Запись архива

Диффузия против авторегрессии: честный бенчмарк от одной лаборатории

В open-source выложена LLaDA2.2 — диффузионная модель 100B от той же лаборатории, что сделала авторегрессивный аналог. Сравнение показало: диффузия проигрывает на знаниях и коде, но выигрывает по скорости на агентных задачах. Никакого переворота — только измеримый трейдофф.

Сравнительный график производительности диффузионной и авторегрессивной моделей
Сравнительный график производительности диффузионной и авторегрессивной моделей
Sias Library – Students Studying 2017.jpg | by Gary Todd | wikimedia_commons | CC0

Что произошло

На Reddit (r/artificial) опубликован разбор свежего бенчмарка LLaDA2.2 — диффузионной модели с открытыми весами, выпущенной лабораторией, которая ранее разработала авторегрессивный аналог сопоставимого размера (100B параметров). Ветка собрала внимание, потому что одна и та же команда впервые поставила свои два подхода на одни и те же тесты, а не выбирала слабого внешнего оппонента.

Почему это обсуждают

Год споров «диффузия против авторегрессии» строился на догадках и общих аргументах. Сейчас появился честный внутрилабораторный замер, где диффузионная модель показала себя неоднозначно. Она проигрывает на задачах знания и кодинга, но выигрывает по скорости на агентных сценариях с несколькими шагами. Это не «диффузия победила», а конкретный трейдофф, который можно измерить.

Что подтверждено, что остаётся неясным

Punkt Detail
Что подтверждено LLaDA2.2 отстаёт от авторегрессивного аналога на общих знаниях и кодинговых тестах.
Что подтверждено На агентных бенчмарках (tau2 bench, MCP Atlas) диффузия опережает авторегрессию на 4–5 пунктов.
Что подтверждено Скорость декодирования выше в 1.6–2.3 раза в зависимости от режима и нагрузки.
Что остаётся неясным Результаты SWE-bench несопоставимы из-за разных scaffolding.
Что остаётся неясным Модель (205.8 ГБ, 100B) почти нереально запустить локально — нет поддержки llama.cpp, сервинг только заявлен.
Что остаётся неясным Авторы признают, что структурированный вывод у диффузионной модели слабее авторегрессионного baseline.

Что дальше

Ключевой практический вывод: для агентных циклов, где каждый шаг требует декодирования, диффузия даёт сопоставимое качество быстрее. Это не смена парадигмы, а повод пересмотреть архитектуру продакшен-агентов. Стоит следить за появлением inference-инструментов и адаптацией под llama.cpp — только тогда модель станет доступна для самостоятельных тестов.

Источник: Reddit r/artificial, обсуждение поста о LLaDA2.2.
Оригинальная публикация: https://www.reddit.com/r/artificial/comments/1v5lhsw/the_diffusion_versus_autoregressive_debate/
Верификация: https://comrad404.com/pulse/