论文
BrowseComp-V3:面向多模态浏览 Agent 的视觉、垂直与可验证基准
BrowseComp-$V^3$: A Visual, Vertical, and Verifiable Benchmark for Multimodal Browsing Agents
摘要
多模态大语言模型(MLLM)凭借日益先进的规划与工具使用能力,正演进为可在开放世界环境中执行多模态网页浏览与深度搜索的自主智能体。然而,现有面向多模态浏览的基准在任务复杂度、证据可得性与评估粒度上仍然有限,阻碍了对深度搜索能力的全面且可复现的评估。为解决这些局限,我们提出 BrowseComp-V3,一个由 300 道精心筛选、覆盖多领域且具挑战性的问题构成的新基准。该基准强调深层、多级与跨模态的多跳推理,其中关键证据在网页内与网页间的文本和视觉模态中交错分布。所有支撑证据都严格要求可公开检索,以确保公平性与可复现性。除最终答案准确率外,我们还纳入经专家验证、以子目标驱动的过程评估机制,可对中间推理行为进行细粒度分析并系统刻画能力边界。此外,我们提出 OmniSeeker,一个整合多种网页搜索与视觉感知工具的统一多模态浏览智能体框架。全面的实验表明,即使最先进的模型在该基准上也仅取得 36% 的准确率,揭示了多模态信息整合与细粒度感知的关键瓶颈。我们的结果凸显了当前模型能力与真实场景中稳健的多模态深度搜索之间的根本差距。
