Запись архива

Бенчмарк агентных фреймворков: AutoGen, CrewAI, LangGraph и MetaGPT провалили строгий тест на Rust-коде

Пользователь Reddit протестировал пять AI-фреймворков на задаче написания Rust-мидлвара с тремя жёсткими ограничениями. Только его собственная система прошла проверку. Результаты вызвали дискуссию о проблемах «LLM-судьи».

Редакционная обложка COMRAD404: Бенчмарк агентных фреймворков: AutoGen, CrewAI, LangGraph и MetaGPT провалили строгий тест на Rust-коде
Редакционная обложка COMRAD404: Бенчмарк агентных фреймворков: AutoGen, CrewAI, LangGraph и MetaGPT провалили строгий тест на Rust-коде
Редакционная тематическая обложка COMRAD404

Что произошло

Пользователь Reddit (r/artificial) опубликовал результаты тестирования пяти AI-фреймворков на задаче написания Rust-мидлвара для аутентификации и ограничения скорости. Задача включала три противоречивых требования: криптографическая безопасность, производительность менее 1 мс при 10 тыс. запросов, 100% покрытие тестами и отсутствие предупреждений clippy.

Почему это вызвало обсуждение

Тест показал, что фреймворки, полагающиеся на «LLM-судью» (AutoGen, CrewAI, MetaGPT), провалили задачу. AutoGen сжёг 517 тыс. токенов в дебатах агентов и выдал нерелевантный код. CrewAI написал WebSocket-хендшейк вместо криптографической аутентификации. MetaGPT сгенерировал почти пустой файл, но отчитался об успехе. LangGraph честно провалился с ошибкой компиляции. Только собственная система автора (GenOS) справилась, используя механическую проверку через компилятор и линтер.

Что подтверждено и остаётся неясным

Автор предоставил детальные логи и описание каждого теста. Однако тест проводился на одной модели (qwen2.5-coder:14b) и одном железе. Результаты могут отличаться на других моделях или задачах. Кроме того, система автора не является открытой, что затрудняет независимую проверку.

Punkt Detail
Источник Reddit r/artificial
Автор Пользователь, создавший фреймворк GenOS
Модель qwen2.5-coder:14b на RTX A4500
Задача Rust-мидлвар с тремя ограничениями
Успех Только GenOS
Причина провала Проблемы с «LLM-судьёй»

Что проверять дальше

Стоит протестировать другие модели (например, Llama 3 или Claude) на аналогичной задаче. Также важно дождаться публикации кода GenOS для независимого воспроизведения. Обсуждение на Reddit продолжается, но пока нет официальных комментариев от разработчиков AutoGen или CrewAI.

Источник: Reddit r/artificial, оригинальный пост https://www.reddit.com/r/artificial/comments/1vya5ko/i_benchmarked_autogen_crewai_langgraph_and/
Верификация: https://comrad404.com/pulse/