论文

MARCA:基于清单的多语言 Web 搜索基准

MARCA: A Checklist-Based Benchmark for Multilingual Web Search

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用作信息源,但其可靠性取决于搜索网络、选择相关证据和综合完整答案的能力。虽然最近的基准评估了网络浏览和代理工具的使用,但多语言设置,特别是葡萄牙语,仍未得到充分探索。我们提出 \textsc{MARCA},一个双语(英语和葡萄牙语)基准,用于评估基于网络的信息搜索的 LLM。 \textsc{MARCA} 由 52 个手动编写的多实体问题组成,并配有手动验证的清单式标题,可明确衡量答案的完整性和正确性。我们在两种交互设置下评估了 14 个模型:具有直接网络搜索和抓取的基本框架,以及通过委派子代理实现任务分解的 Orchestrator 框架。为了捕获随机性,每个问题都会执行多次,并以运行级别的不确定性来报告性能。在各个模型中,我们观察到巨大的性能差异,发现编排通常可以提高覆盖范围,并发现模型从英语转换为葡萄牙语的方式存在巨大差异。该基准可在 https://github.com/maritaca-ai/MARCA 获取