论文
TourPlanner:面向旅行规划的带约束门控强化学习的竞争性共识框架
TourPlanner: A Competitive Consensus Framework with Constraint-Gated Reinforcement Learning for Travel Planning
摘要
旅行规划是一个复杂的决策过程,需要综合多方面信息来构建行程。然而,现有旅行规划方法面临若干挑战:(1) 在保持高召回率的同时剪枝候选兴趣点(POI);(2) 单一推理路径限制了在旅行规划可行解空间内的探索能力;(3) 同时优化硬约束和软约束仍是一个显著难题。为应对这些挑战,我们提出 TourPlanner,一个以多路径推理与约束门控强化学习为特色的综合框架。具体而言,我们首先引入个性化召回与空间优化(PReSO)工作流,构建具有空间感知的候选 POI 集合。随后,我们提出竞争性共识思维链(CCoT),一种提升可行解空间探索能力的多路径推理范式。为进一步精化规划,我们在强化学习阶段引入基于 sigmoid 的门控机制,在硬约束得到满足之后才动态地优先满足软约束。在旅行规划基准上的实验结果表明,TourPlanner 取得最先进的性能,在可行性和用户偏好对齐两方面均显著超越现有方法。
