论文

超越单语言深度研究:使用跨语言 BrowseComp-Plus 评估代理和 检索器

Beyond Monolingual Deep Research: Evaluating Agents and Retrievers with Cross-Lingual BrowseComp-Plus

智能体系统Agent任务评测

摘要

深度研究人员越来越多地评估其搜索证据、对检索到的资源进行推理以及得出有根据的答案的能力。然而,现有的浏览基准在很大程度上假设用户的查询和支持证据是用同一种语言编写的,当相关证据以另一种语言出现时,代理搜索系统是否可以运行尚不确定。我们引入了 XBCP(跨语言 BrowseComp-Plus),这是一种受控基准,保留了 BrowseComp-Plus 的英语问答空间,但改变了支持文档的语言。 XBCP 实例化两个互补设置:在跨语言设置中,每个查询都与单一指定语言的证据配对。在多语言环境中,完整的证据语料库均匀且随机地分布在跨越高资源和低资源体系的 12 种语言中。我们使用稀疏和密集多语言 检索器 评估四个深度研究代理,测量答案准确性、证据召回率、搜索行为、校准、引文保真度和预言检索。结果表明,当证据被翻译时,质量会大幅下降。即使是强大、密集的 检索器 也会失去证据召回率,智能体的校准能力会降低,引用证据的可靠性也会降低。值得注意的是,即使直接提供所有标准证据,准确性仍然较低。这些发现表明,跨语言深度研究暴露了检索失败和独立的代理方在整合语言不匹配证据方面的困难。