论文
当深度研究代理停滞时:通过检索感知代理控制增强推理
When Deep Research Agents Stagnate: Enhancing Reasoning with Retrieval-Aware Agent Control
摘要
在本文中,我们分析了各种 DRA 的推理轨迹,并表明现有的智能体经常遭受推理停滞的困扰:大多数迭代对最终性能的贡献很小或没有贡献,而智能体缺乏对其轨迹的认识,因此无法有效地调整其搜索策略或确定何时终止。为了解决这个问题,我们引入了一组无监督信号和检索感知代理控制器(RAAC),它可以帮助代理在研究过程的每个阶段选择最佳操作。 RAAC 结合了关键的信息检索原则,即搜索新颖性和信息覆盖率,从而产生更有效的推理轨迹,从而提高整体性能,同时减少不必要的迭代,从而降低成本和延迟。特别是在 BrowseComp-Plus 和大量 DRA 上,添加 RAAC 可以将搜索调用数量平均减少 14 个,显着提高召回率和准确性方面表现最佳的 DRA,并实现高达 10% 的准确性增益(平均 3%)。