论文
AREX:迈向递归自改进的深度研究智能体
AREX: Towards a Recursively Self-Improving Agent for Deep Research
摘要
深度研究要求智能体找到联合满足多重约束的答案。发现这样的答案代价高昂,而验证一个候选常可分解为可驾驭的逐约束检查。这一发现—验证不对称提示研究智能体应做的超延长搜索:它应递归改进当前答案——验证中间结果、并以部分验证状态引导后续精炼。我们提出AREX,一族递归自改进(RSI)深度研究智能体。AREX在内层研究循环(收集证据、构建临时答案)与外层自改进循环(逐约束审计答案、识别未决论断、发起定向后续研究)之间交替。为在长时程上维持RSI,AREX学习一个自主上下文更新工具:把不断增长的交互历史压缩为紧凑的改进状态——保存已验证证据与未决约束——不依赖外部模型。AREX在经验证的合成任务与高质量轨迹上经智能体中期训练与长程强化学习训练;为缓解长时程学习中的稀疏最终奖励,我们强调取得决定性证据或纠正错误研究方向的关键步骤。我们实例化稠密4B模型与122B-A10B混合专家模型。跨BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Exam(HLE)及其他推理与工具使用基准,AREX大幅超过同规模基线,并与使用多得多的激活参数的模型保持竞争力。
