论文

VeriTrip:面向非结构化网络语料的旅行规划智能体可验证基准

VeriTrip: A Verifiable Benchmark for Travel Planning Agents over Unstructured Web Corpora

智能体系统Agent任务评测

摘要

既有基准通过建立以API为中心的范式,为旅行规划智能体奠定了基础。然而,随着自主智能体能力的持续进步,其评估必须超越简单的工具执行,转向应对开放网络固有的复杂性。当前基准绕开了核心认知难关:它们未考虑信息噪声,忽视多来源事实矛盾,并忽略了将视觉感知落地到逻辑规划中的必要性。我们提出VeriTrip,一个旨在满足对智能体鲁棒性与可靠性日益增长需求的可验证基准。VeriTrip将评估重心转移到对非结构化多模态网络语料的基于证据的推理上。它建立了源自真实世界来源的多模态检索库(MRB),迫使智能体自主编排跨异构数据的查询。与之同步的可验证知识库(VKB)支持逐单元格的验证协议,精确量化事实可靠性,将系统性推理失败与参数化幻觉区分开来。我们对领先MLLM的评估揭示了一个关键的检索—推理权衡(retrieval-reasoning trade-off):自主检索的认知负荷会显著侵蚀指令保持能力。VeriTrip为下一代能够在无约束多模态环境中运行的规划智能体提供了必要的严格基础。

VeriTrip:面向非结构化网络语料的旅行规划智能体可验证基准:论文配图
图 1:可以在 VeriTrip 中完全执行的基于检索的高级规划任务。成功需要复杂的跨模式消歧和积极的信息搜索。为了实现用户的目标,智能体需要 (1) 利用视觉工具来解决模糊的视觉锚点(例如社交媒体照片),(2) 迭代调用文本工具从非结构化多模态检索库 (MRB) 中搜索和收集原始证据,以及 (3) 在不依赖参数记忆的情况下合成基于事实的行程。