论文
评估Deep Research智能体中的随机性
Evaluating Stochasticity in Deep Research Agents
摘要
Deep Research智能体(DRA)是一类有前景的智能体系统,它们收集并综合信息,以支持金融决策、医学分析和科学发现等领域的研究。尽管近期研究质量有所提升(例如在有真实答案时的结果准确率),DRA系统设计常常忽视现实部署的一个关键障碍:随机性。在相同查询下,DRA的重复执行在研究结果、发现和引用方面可能表现出巨大差异。本文通过将DRA建模为信息获取马尔可夫决策过程,把对DRA随机性的研究形式化。我们引入一个量化系统方差的评估框架,并识别出三个方差来源:信息获取、信息压缩和推理。通过受控实验,我们考察这些模块在不同决策步骤产生的随机性如何影响DRA输出的方差。我们的结果表明,降低随机性可以提升研究输出质量,其中推理和早期阶段的随机性对DRA输出方差贡献最大。基于这些发现,我们提出通过结构化输出和基于集成的查询生成来缓解随机性同时保持输出质量的策略。我们在DeepSearchQA上的实验表明,所提缓解方法将平均随机性降低22%,同时保持较高的研究质量。
