论文

DRNOISE:在误导性证据环境中对深度研究代理进行基准测试

DRNOISE: Benchmarking Deep Research Agents in Misleading Evidence Environments

智能体系统Agent任务评测

摘要

深度研究机构越来越多地在开放网络上运作,相关记录与冗余摘要、过时的报告和误导性文件共存。当一份看似普通的虚假文件被故意植入可搜索环境并提供一条通向相互矛盾的答案的直接捷径时,现有的评估对于智能体是否保留合理的证据标准提供的见解有限。我们引入了 DRNOISE,这是一个在误导性证据下恢复答案的 100 项任务基准。每项任务都有一个独特的标准答案,并由两个证实的间接记录链支持;配对的噪声条件添加了一个看似合理的文档,该文档直接陈述了一个相互矛盾的答案。该基准涵盖十个证据操作系列。对于具有强大清洁任务表现的代理来说,这种单一干预会导致准确率下降 66-88 个百分点。跟踪分析将验证惰性视为主​​要的失败模式:代理经常检索真实的记录,但在完成和协调证据链之前停止,而不是遵循类似答案的文档。通用验证提示可以减少但不能缩小这一差距。该设置与开放网络部署尤其相关,在开放网络部署中,看似合理的谎言是通过看似普通的页面而不是明确的攻击到达的。因此,可靠的深入研究需要的不仅仅是检索和引用;它需要对直接索赔与创纪录水平的证据进行积极协调。