论文

EvoBrowseComp:不断发展的知识对搜索代理进行基准测试

EvoBrowseComp: Benchmarking Search Agents on Evolving Knowledge

智能体系统Agent任务评测

摘要

搜索代理——大语言模型 增强了搜索工具——增强了对面向未来的评估基准的需求。 BrowseComp 等现有基准测试依赖于静态知识,这使得它们容易受到测试集污染和参数记忆的影响。因此,模型可以通过事实回忆而不是真正的检索来获得高分,从而通过推理捷径掩盖真实的浏览能力。在本文中,我们介绍了 EvoBrowseComp,这是一个通过实时网络遍历合成的 400 个英语和 400 个中文无污染复杂问题的不断发展的基准。为了收集这些问题,我们设计了一个三代理协作框架:(1)一个 QA 合成代理,从实时网络中检索新知识来合成 QA 对; (2) 信息过滤代理,根据可信度和流行度过滤检索到的知识,以阻止参数捷径; (3)一个高级指导代理,将问题形式化为推理图,以减少合成问答对中的逻辑冗余和捷径。由于该框架支持全自动合成,因此 EvoBrowseComp 可以定期更新,以防止数据污染并保持时间新鲜度。大量的实验证实了它的巨大难度,需要广泛的横向搜索。它为可自动更新、高难度的基准测试建立了一个可扩展的范例,与不断发展的世界知识和不断进步的代理能力保持同步。