论文

SeekerGym:可靠信息搜索的基准

SeekerGym: A Benchmark for Reliable Information Seeking

智能体系统Agent任务评测

摘要

尽管取得了巨大的成功,人工智能代理在可信度方面仍然面临着根本性的挑战。考虑深度研究代理,其任务是搜索与给定主题相关的信息——虽然人工智能代理可以执行有效的信息检索,但几乎无法保证这些信息的完整性。即使所提供的信息是正确且相关的,检索到的信息中的差距也可能会产生误导用户的偏见。我们引入了 SeekerGym,这是一个旨在评估人工智能代理检索信息完整性的基准。此外,SeekerGym 还衡量代理商量化信息完整性不确定性的程度;如果代理无法检索所有相关信息,那么至少量化可能丢失的信息是有用的。从较高层面来看,SeekerGym 中的每个任务都是一个文档(例如,维基百科文章),并且 AI 代理必须发出查询以从该文档中检索段落。直观上,文档全面涵盖了一个主题,因此检索其部分的能力直接衡量信息检索的完整性。除了维基百科之外,我们还考虑机器学习调查论文,其目标是检索调查论文的相关部分。我们对多种模型和算法进行基准测试;最好的方法可以检索 Wikipedia 上 42.5% 的段落,以及 ML Surveys 上 29.2% 的段落,还有很大的改进空间。