MERRIN:嘈杂网络环境中多模式证据检索和推理的基准
MERRIN: A Benchmark for Multimodal Evidence Retrieval and Reasoning in Noisy Web Environments
摘要
受搜索查询的不明确、多跳性质以及现实世界网络结果的多模态、异构性和经常冲突的性质的启发,我们引入了 MERRIN(嘈杂网络环境中的多模态证据检索和推理),这是一个用于评估搜索增强代理的人工注释基准。 MERRIN 衡量人工智能代理识别相关模式、检索多模式证据以及在嘈杂的网络资源上执行多跳推理的能力。它与之前的工作在三个重要方面有所不同:(1) 使用没有明确模态提示的自然语言查询,(2) 结合视频和音频等未充分探索的模态,以及 (3) 在网络搜索过程中需要检索复杂、通常有噪音或冲突的多模态证据。我们评估了由十个模型支持的各种搜索代理,包括强大的闭源模型(例如,GPT-5.4-mini、Gemini 3/3.1 Flash/Pro)和开放权重模型(Qwen3-4B/30B/235B),跨越三种搜索设置(无搜索、本机搜索和代理搜索)。我们的结果表明,MERRIN 非常具有挑战性:所有智能体的平均准确率为 22.3%,表现最好的智能体仅达到 40.1%。我们进一步观察到,虽然像 Gemini Deep Research 这样更强大的智能体取得了更高的性能,但由于过度探索,收益不大;他们采取更多步骤并使用更多工具,但经常会因相互冲突或部分相关的网络内容而分心,从而导致错误的答案。与人类相比,这些智能体消耗更多资源,但准确性较低,这主要是由于低效的源选择和对文本模式的过度依赖。这些发现凸显了搜索代理需要能够在嘈杂的网络环境中跨多种模式进行稳健的搜索和推理,从而使 MERRIN 成为评估此类功能的宝贵测试平台。