论文
Behaviour2Trip:通过用户行为轨迹实现个性化旅行规划
Behavior2Trip: Towards Personalized Travel Planning via User Behavior Trajectory
摘要
旅行规划代理通过模拟用户的个人偏好来帮助用户制定个性化的旅行计划。现有的代理要么依赖明确的用户指令,要么进行多轮澄清以引出用户偏好。然而,这两种方法都忽略了用户过去行为中隐藏的丰富行为信号,这些信号隐式地编码了他们的偏好。这种对主动用户输入的过度依赖增加了交互负担并限制了计划的个性化。为了弥补这一差距,我们引入了一项新任务——行为感知旅行规划,它直接从过去的行为推断用户偏好并生成个性化的旅行计划。为了促进这项任务的研究,我们引入了Behavior2Trip,这是一个由中国最大的在线旅游平台之一构建的基准,包含 11,400 个实例。每个实例平均代表 39.8 种过去的用户行为,涵盖 5 个偏好维度的 14 个属性。我们进一步提出了 B2T-Agent,这是一种基于强化学习的代理,它利用用户行为轨迹,与外部工具交互以进行偏好对齐检索,并维护内部记忆模块。在Behavior2Trip上的实验表明,GPT-4.1在最困难的任务上仅实现了0.5%的全约束通过率,而基于Qwen3-8B构建的B2T-Agent优于所有基线,凸显了该任务的巨大挑战。此外,使用 B2T-Agent 训练的 Qwen3-8B 在 TravelPlanner 基准测试中也优于 GPT-4.1,表现出很强的泛化能力。代码和数据可在 https://github.com/BUAA-IRIP-LLM/Behavior2Trip 获取