
Исследователи представили DeReAct — модульную архитектуру для AI-агентов, которая выносит проверку действий и контроль завершения задачи за пределы основной языковой модели. Работа опубликована на arXiv под номером 2610.02351.
Что изменилось
В классическом ReAct один LLM-процесс одновременно рассуждает, выбирает действие, взаимодействует со средой и решает, выполнена ли задача. Такая связность создаёт два риска: ошибочное действие может быть сразу исполнено, а неподтверждённое утверждение о завершении — преждевременно остановить работу агента.
DeReAct разделяет эти функции между несколькими компонентами:
• Brain предлагает следующий шаг и формирует рассуждение;
• Critic проверяет предложенное действие до его выполнения;
• Context Manager восстанавливает состояние среды и подтверждает, действительно ли задача завершена.
Таким образом, основной модели не нужно единолично авторизовать собственные действия и выносить финальный вердикт по результату. Контроль становится отдельным этапом агентного цикла.
Результаты экспериментов
Авторы протестировали подход на наборах GAIA и SWE-bench Verified. Наибольший эффект наблюдался у менее сильных «мозговых» моделей: прирост Pass@1 для Qwen3-Coder-480B составил 6,5–7,0 процентного пункта, а для Claude Sonnet 4.5 — 4,2–5,2 пункта.
При усилении основной модели преимущество сокращается. Для Claude Opus 4.5 показатель Pass@1 оказался сопоставим с обычным ReAct. При этом траектории DeReAct, согласно анализу авторов, чаще содержали необходимые подтверждения и лучше соблюдали ограничения задачи. Иными словами, агент мог завершать работу позже, но с более полной опорой на состояние среды.
Практический смысл
Главная идея DeReAct полезна для инструментальных агентов, которые работают с кодом, API, файлами или внешними сервисами. Проверка перед исполнением может снизить число необоснованных операций, а отдельный модуль завершения — не дать агенту объявить задачу выполненной без достаточных доказательств.
Однако это не универсальная замена более сильной модели. Эффект зависит от того, насколько часто в конкретном сценарии встречаются ошибки, на которые способен реагировать Critic, и достаточно ли компетентен сам контролирующий модуль. Если проверяющая политика не может правильно оценить действие, дополнительный слой не гарантирует надёжность.
Авторы также показывают компромисс между скоростью и обоснованностью: более строгий контроль завершения способен увеличить число шагов и задержку, зато уменьшает вероятность раннего выхода без подтверждённого результата. Для инженерных систем это означает, что DeReAct стоит оценивать не только по Pass@1, но и по стоимости выполнения, числу итераций и полноте доказательств.
Источники










