论文

UTP-Bench:不确定性感知的旅行规划基准

UTP-Bench: Uncertainty-aware Travel Planning Benchmark

模型评测基准与评测资源

摘要

大语言模型 (LLM) 最近展示了自动旅行行程生成方面的强大功能。然而,现实世界的旅行计划本质上是不确定的:交通延误、人群波动和意外的随机延误经常使原本可行的时间表失效。 TravelPlanner 和 TripCraft 等现有基准假设确定性环境,仅评估静态约束满足情况,并忽略在出现此类不确定性时生成的计划是否保持稳健。为了解决这一限制,我们引入了 UTP-Bench1,这是一个用于不确定性感知旅行计划的大规模基准。该数据集集成了印度 504 个城市的真实旅行数据,包括景点、餐厅、住宿和多式联运网络。为了模拟现实的干扰,UTP-Bench 结合了从主要城市收集的经验延误分布和人群密度模式,从而能够在随机条件下评估旅行计划。我们进一步提出了三个评估指标,即缓冲区充足性评分(BAS)、人群感知计时评分(CATS)和运输延迟吸收评分(TDAS),它们量化了生成的行程保持针对交通延误和人群变化的鲁棒性的能力。对 GPT-5、Qwen3、Mistral 和 Phi-4 等最先进的 LLM 进行的实验揭示了模型生成的计划与人类编写的计划之间存在巨大差距,特别是在时间缓冲、延迟感知交通调度和人群敏感规划方面。

UTP-Bench:不确定性感知的旅行规划基准:论文配图
图1:UTP-Bunch:缩小僵硬的旅行计划与现实世界不确定性之间的差距