论文

Trip+:个性化交互式旅行规划中的智能体基准

Trip+: Benchmarking Agents in Personalized Interactive Travel Planning

智能体系统Agent任务评测

摘要

交互式旅行规划已成为语言模型的流行用例。智能体被部署以在多轮中管理演化的偏好与意外干扰。此类设定要求模型做出复杂的、画像条件化的规划决策。但既有基准常在相对孤立的设定中评估可行性、个性化或交互。因此——我们介绍Trip+——整体测量智能体规划旅行能力。Trip+中——给定旅行者画像与动态交互——智能体必须生成并修订分钟级行程。端到端旅行者体验经基于LLM的模拟器评估——支持疲劳等主观指标评估。我们的场景从简单请求解决到复杂的环境驱动重规划。我们评估18个语言模型——发现体验质量的持续缺口:模型偏爱技术可行但令人疲惫的行程——与画像旅行者偏好 sharp 分歧。

Trip+:个性化交互式旅行规划中的智能体基准:论文配图
图2:Trip+的总体设计,用于评估复杂旅行规划场景中的语言代理。