论文

TourPlanner:面向旅行规划的带约束门控强化学习的竞争性共识框架

TourPlanner: A Competitive Consensus Framework with Constraint-Gated Reinforcement Learning for Travel Planning

模型训练强化学习Agentic RL

摘要

旅行规划是一个复杂的决策过程,需要综合多方面信息来构建行程。然而,现有旅行规划方法面临若干挑战:(1) 在保持高召回率的同时剪枝候选兴趣点(POI);(2) 单一推理路径限制了在旅行规划可行解空间内的探索能力;(3) 同时优化硬约束和软约束仍是一个显著难题。为应对这些挑战,我们提出 TourPlanner,一个以多路径推理与约束门控强化学习为特色的综合框架。具体而言,我们首先引入个性化召回与空间优化(PReSO)工作流,构建具有空间感知的候选 POI 集合。随后,我们提出竞争性共识思维链(CCoT),一种提升可行解空间探索能力的多路径推理范式。为进一步精化规划,我们在强化学习阶段引入基于 sigmoid 的门控机制,在硬约束得到满足之后才动态地优先满足软约束。在旅行规划基准上的实验结果表明,TourPlanner 取得最先进的性能,在可行性和用户偏好对齐两方面均显著超越现有方法。

TourPlanner:面向旅行规划的带约束门控强化学习的竞争性共识框架 配图
图 1:TourPlanner 框架概览。在收到用户查询后,该框架通过 PReSO 工作流构建候选信息,以支持 CCoT 过程。CCoT 包含三个主要阶段:(1) 智能体实例化(Agent Instantiation),随后针对 d 天中的每一天进行 (2) 并行方案生成(Parallel Proposal Generation)与 (3) 竞争与共识仲裁(Competition and Consensus Arbitration)的迭代循环。在仲裁期间,系统将 top-k 方案合成为每日计划。最后,约束门控 RL 模块对共识行程进行精炼,同时优化软约束(个性化)与硬约束(可行性)。