论文

搜索形成结论:审计深度研究Agent中的证据选择偏差

Search Shapes Conclusions: Auditing Evidence Selection Bias in Deep Research Agents

模型评测评测方法与指标

摘要

深度研究人员将证据综合到引用的报告中,但引用充分的报告仍然可能得出误导性的结论。引文正确性检查引用来源是否支持个人主张。它没有显示自适应搜索是否公开了可供评估的所有文档的代表性视图(我们称之为候选池)。早期的发现会重定向后来的查询、文档选择和停止,因此Agent读取的文档形成选择性样本。现有的评估很少考虑到这种选择。我们将问题表述为自适应证据采样,并引入因果证据选择校正(CESS)。 CESS 预测每个候选文档的证据方向,并使用选择每个文档和到达每个搜索轮的记录概率来校正候选池平均值。收缩可以稳定短搜索,而当某些文档无法采样时,间隔会取代点估计。我们还证明,估计公共池的平均证据方向不同于衡量搜索策略的变化如何改变所读取的证据。后者需要干预。对于来自 MS2 系统评审基准的问题,相对于所读文档的平均证据分数,CESS 将候选库平均值的平均绝对误差减少了 $9.2\%$,并将相反文档排名下的估计变化减少了 $39.4\%$。从公共 Open Deep Research Agent的轨迹来看,相应的减少额达到 60.1\%$ 和 87.2\%$。配对干预下的另外 4,800 个轨迹证实,纠正池估计和衡量政策效果是不同的任务。因此,CESS 会审核报告背后的证据方向是否反映了可用于评估的文件,而单独的干预分析则衡量检索决策的效果。