论文
GroupTravelBench:对 LLM 代理进行多人旅行规划基准测试
GroupTravelBench: Benchmarking LLM Agents on Multi-Person Travel Planning
摘要
现实世界中的旅行计划绝大多数是 \textit{group} 活动,但现有的 LLM 旅行计划基准将其减少到单个用户,该领域已接近饱和。这种单用户假设回避了使代理难以进行群体规划的因素:发现多个用户的私人偏好、暴露冲突以及平衡效用与公平。为了使任务回到多用户现实,我们引入了 \textbf{\textit{GroupTravelBench}},这是 \textbf{多用户、多回合}旅行规划的第一个基准。它根据真实的用户资料、POI 数据和门票价格构建,包含三个难度级别的 650 个任务,每个任务都在同步群聊沙箱中运行,并带有缓存的工具数据,用于可重现的离线评估。除了单用户基准测试已经测试的多步骤推理和工具使用之外,GroupTravelBench 还探索了三种特定于群体的功能:通过多轮对话来\textit{(i) 启发}私人偏好; \textit{(ii) 通过妥协或分组协调用户间冲突;和 \textit{(iii) 规划} 平衡群体效用与公平。我们将其与结合基于规则的结果指标和 LLM 判断过程指标的补充评估框架配对。在各种前沿模型中,即使是最强大的代理商也无法满足所有四个基于规则的结果指标,计划有效性低于 12%,这表明团体级别的结果质量是 LLM 旅行规划代理商面临的一个关键的公开挑战。