论文
DeReAct:分解推理与执行的可靠智能体
DeReAct: Decomposed Reasoning and Acting for Reliable AI Agents
摘要
基于ReAct的智能体通常依赖单一LLM策略提议动作、与环境交互并判断任务完成。这种耦合使动作授权与完成控制难以独立执行,让错误传播、无支撑的完成声明终止执行。我们提出DeReAct,一个模块化智能体架构,外置两种门控策略:在执行前验证提议动作的Critic,以及重建环境支持STATE并认证任务完成的Context Manager。在GAIA与SWE-bench Verified上,DeReAct对较弱Brain模型的Pass@1提升最大:Qwen3-Coder-480B提升6.5-7.0点,Claude Sonnet 4.5提升4.2-5.2点;随Brain能力增强收益递减。轨迹与消融分析显示,当目标失败足够普遍且门控策略自身充分时外部门控有效。使用Claude Opus 4.5时Pass@1与ReAct相当,但DeReAct产出证据更完整、更满足约束的轨迹,说明完成控制可以牺牲较早终止,换取更强的证据支撑。总体上DeReAct改善较弱智能体,并在模型变强时保留落地收益。