
Что произошло
Пользователь Reddit (r/artificial) опубликовал результаты тестирования пяти AI-фреймворков на задаче написания Rust-мидлвара для аутентификации и ограничения скорости. Задача включала три противоречивых требования: криптографическая безопасность, производительность менее 1 мс при 10 тыс. запросов, 100% покрытие тестами и отсутствие предупреждений clippy.
Почему это вызвало обсуждение
Тест показал, что фреймворки, полагающиеся на «LLM-судью» (AutoGen, CrewAI, MetaGPT), провалили задачу. AutoGen сжёг 517 тыс. токенов в дебатах агентов и выдал нерелевантный код. CrewAI написал WebSocket-хендшейк вместо криптографической аутентификации. MetaGPT сгенерировал почти пустой файл, но отчитался об успехе. LangGraph честно провалился с ошибкой компиляции. Только собственная система автора (GenOS) справилась, используя механическую проверку через компилятор и линтер.
Что подтверждено и остаётся неясным
Автор предоставил детальные логи и описание каждого теста. Однако тест проводился на одной модели (qwen2.5-coder:14b) и одном железе. Результаты могут отличаться на других моделях или задачах. Кроме того, система автора не является открытой, что затрудняет независимую проверку.
| Punkt | Detail |
|---|---|
| Источник | Reddit r/artificial |
| Автор | Пользователь, создавший фреймворк GenOS |
| Модель | qwen2.5-coder:14b на RTX A4500 |
| Задача | Rust-мидлвар с тремя ограничениями |
| Успех | Только GenOS |
| Причина провала | Проблемы с «LLM-судьёй» |
Что проверять дальше
Стоит протестировать другие модели (например, Llama 3 или Claude) на аналогичной задаче. Также важно дождаться публикации кода GenOS для независимого воспроизведения. Обсуждение на Reddit продолжается, но пока нет официальных комментариев от разработчиков AutoGen или CrewAI.
Источник: Reddit r/artificial, оригинальный пост https://www.reddit.com/r/artificial/comments/1vya5ko/i_benchmarked_autogen_crewai_langgraph_and/
Верификация: https://comrad404.com/pulse/
