论文
过程级反馈下深度研究智能体的多轮评估
Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback
摘要
深度研究代理 (DRA) 的现有基准仅评估单次输出,忽略了一个关键问题:DRA 在反馈的指导下能否改进其报告?为了研究这一点,我们在两种反馈设置下对 DRA 进行多轮评估:自我反思,其中代理在没有任何外部诊断信号的情况下修改其报告,以及过程级反馈,其中代理收到针对其研究策略中的差距的指导。为了实现过程级反馈,我们设计了研究差距推断(RGI),这是一种通过分析满意和不满意的评估标准的模式来推断研究过程差距的方法。我们的分析揭示了三个关键发现:(i)在自我反思下,代理人以几乎相同的速度纳入和回归标题标准,产生的净改进可以忽略不计; (ii) 单轮流程级反馈可带来巨大收益,将标准化分数提高约 $8$-$15$ 点,并产生约 $35$-$40\%$ 的合并率; (iii) 这些收益不会在后续回合中复合,因为在重写完整报告以解决剩余差距时,代理会在先前满足的标准上回归高达 $24\%$。即使有针对性的指导,我们评估的 DRA 架构仍然无法实现可靠的多轮改进。我们的代码和结果可在 https://github.com/sabharwalrishabh/Multi-Turn-Evaluation-of-DRAs 上公开获取。
