论文

过程级反馈下深度研究智能体的多轮评估

Multi-Turn Evaluation of Deep Research Agents Under Process-Level Feedback

智能体系统Agent任务评测

摘要

深度研究代理 (DRA) 的现有基准仅评估单次输出,忽略了一个关键问题:DRA 在反馈的指导下能否改进其报告?为了研究这一点,我们在两种反馈设置下对 DRA 进行多轮评估:自我反思,其中代理在没有任何外部诊断信号的情况下修改其报告,以及过程级反馈,其中代理收到针对其研究策略中的差距的指导。为了实现过程级反馈,我们设计了研究差距推断(RGI),这是一种通过分析满意和不满意的评估标准的模式来推断研究过程差距的方法。我们的分析揭示了三个关键发现:(i)在自我反思下,代理人以几乎相同的速度纳入和回归标题标准,产生的净改进可以忽略不计; (ii) 单轮流程级反馈可带来巨大收益,将标准化分数提高约 $8$-$15$ 点,并产生约 $35$-$40\%$ 的合并率; (iii) 这些收益不会在后续回合中复合,因为在重写完整报告以解决剩余差距时,代理会在先前满足的标准上回归高达 $24\%$。即使有针对性的指导,我们评估的 DRA 架构仍然无法实现可靠的多轮改进。我们的代码和结果可在 https://github.com/sabharwalrishabh/Multi-Turn-Evaluation-of-DRAs 上公开获取。

过程级反馈下深度研究智能体的多轮评估:论文配图
图 1:流程级反馈生成。给定针对 DRACO 评分标准评估的报告 rt−1r_{t-1},RGI 分析来自 FA、BD 和 CQ(不包括 PQ)的满意和不满意标准的模式,以推断研究过程差距并为下一回合生成过程级反馈 ft−1f_{t-1}。所示标准示例用于说明;为简单起见,排除了负权重标准。