论文

MobilityBench:评测真实出行场景中路径规划智能体的基准

MobilityBench: A Benchmark for Evaluating Route-Planning Agents in Real-World Mobility Scenarios

智能体系统Agent任务评测

摘要

由大语言模型(LLM)驱动的路径规划智能体,通过自然语言交互与工具中介决策支持日常人类出行,已成为有前景的范式。然而,真实出行环境中的系统评估受制于多样的路线需求、非确定性的地图服务以及有限的可复现性。本研究提出 MobilityBench,一个可扩展的基准,用于在真实出行场景中评估基于 LLM 的路径规划智能体。MobilityBench 基于从高德(Amap)收集的大规模匿名真实用户查询构建,覆盖全球多个城市广泛的路径规划意图。为实现可复现的端到端评估,我们设计了确定性 API 回放沙箱,消除在线服务的环境方差。我们进一步提出以结果有效性为核心的多维评估协议,辅以对指令理解、规划、工具使用与效率的评估。利用 MobilityBench,我们在多样真实出行场景中评估多个基于 LLM 的路径规划智能体,并深入分析其行为与表现。我们的发现揭示,当前模型在基础信息检索与路线规划任务上表现合格,但在偏好约束路径规划上明显吃力,凸显个性化出行应用仍有巨大改进空间。我们在 https://github.com/AMAP-ML/MobilityBench 公开发布基准数据、评估工具与文档。

MobilityBench:评测真实出行场景中路径规划智能体的基准
图1:MobilityBench 概览,这是一个用于评估路线规划智能体的系统性基准。