论文

TravelEval:评估LLM驱动的旅行规划智能体的综合基准框架

TravelEval: A Comprehensive Benchmarking Framework for Evaluating LLM-Powered Travel Planning Agents

智能体系统Agent任务评测

摘要

大型语言模型(LLM)的发展显著改善了旅行规划应用,但对这类模型的评估受限于现有基准的不足:1)过度强调约束符合性,忽视时空成本等多维质量;2)数据集缺乏真实世界真实性,在住宿、交通等关键领域覆盖不足;3)逐日孤立的行程评估遗漏了整条行程评估所需的关键细节(如每日住宿和游览节奏的影响)。为弥补这一空白,我们提出TravelEval,一个真实且全面的基准。TravelEval的特点包括:1)一个新颖的六维评估框架,从准确性、合规性、时间性、空间性、经济性和实用性维度整体评估行程;2)一个高度真实的数据沙盒,包含精确的住宿定价和真实的城际交通数据;3)一种基于仿真的全局评估方法,通过集成API的地理信息和细粒度排队时间来模拟完整旅行计划。用TravelEval评估12种主流方法揭示了若干有价值的洞见,例如LLM难以完成全局优化的多维规划(尤其在时空推理和预算合规方面),而智能体推理策略并未带来一致改进。简言之,TravelEval通过符合现实约束的的时空仿真和全面的指标便利了旅行计划评估,为推进LLM驱动的旅行规划研究与应用提供了坚实基础。

TravelEval:评估LLM驱动的旅行规划智能体的综合基准框架:论文配图
图1:智能体生成的旅行计划示例,配合TravelEval框架评估LLM旅行规划智能体的规划质量。