SWE-agent и OpenHands на SWE-bench: что показали ИИ-инженеры в 2024 году
Исторический обзор SWE-agent и OpenHands по первоисточникам 2024 года: как устроены их агенты, что именно они мерили на SWE-bench и...
Тема COMRAD404
Исторический обзор SWE-agent и OpenHands по первоисточникам 2024 года: как устроены их агенты, что именно они мерили на SWE-bench и...
Разбираем, что именно стандартизует Model Context Protocol, как в нём устроены tools, resources и prompts, и чем запуск Anthropic в...
OSWorld, WebArena, GAIA и τ-bench часто ставят в один ряд, хотя они измеряют разные вещи: GUI-действия, веб-навигацию, исследовательский tool use...
Практическое сравнение AutoGen, CrewAI и LangGraph по официальным paper, блогам и документации: где живёт состояние, как устроен control flow, чем...
Разбираем AI co-scientist от Google: релиз 2025 года и peer-reviewed версия 2026-го. Как устроен мультиагентный «турнир идей», что показали оценки...
Разбираем Operator в исторической версии запуска 23 января 2025 года: как модель CUA видит веб через скриншоты, где выигрывает, где...
Разбираем запуск Computer Use от Anthropic 22 октября 2024 года: как Claude 3.5 Sonnet работает со скриншотами, почему упирается в...