论文
AREX-2:通过长期反思任务推进自我改进Agent
AREX-2: Advancing Self-Improving Agents through Long-Horizon Reflective Tasks
摘要
我们提出 AREX-2,旨在提高 LLM Agent的自我改进能力,我们将其定义为在测试时迭代完善解决方案的能力。这种能力依赖于两种互补的能力:反射,它产生比当前解决方案更好的解决方案;以及长期执行,它使迭代在多轮中保持有效。我们假设这两种功能都是与领域无关的,因此可以在非常适合监督的场景中学习。因此,我们从机器学习和算法编程任务中综合了长期改进轨迹,这两个领域提供了可验证的反馈并奖励持续迭代。根据这些数据进行训练,我们的Agent基于 Qwen3.8-27B 构建,在 MLE-bench Lite (81.8) 和 Frontier-CS (70.7) 上取得了优异的成绩,并转向深度研究,在 BrowseComp 上获得 84.0、在 HLE 上获得 52.6、在 GAIA 上获得 92.2、在 DeepSearchQA 上获得 93.8,并且随着轮次预算的增长而不断提高。这些结果表明,长期反思性数据是实现自我改进的有效途径。