论文

HiMAP-Travel:面向长程受限旅行的分层多Agent规划

HiMAP-Travel: Hierarchical Multi-Agent Planning for Long-Horizon Constrained Travel

智能体系统模型训练强化学习Agent 协作RLVRAgentic RL

摘要

顺序执行的LLM Agent在带硬约束(如预算和多样性要求)的长程规划上表现不佳。随着规划推进和上下文增长,这些Agent会偏离全局约束。我们提出HiMAP-Travel,一个将规划拆分为战略协调与并行日级执行的分层多Agent框架。Coordinator跨天分配资源,而Day Executor并行地独立规划。三个关键机制支撑这一框架:在并行Agent之间强制执行预算和唯一性约束的事务型监视器、允许Agent拒绝不可行子目标并触发重新规划的议价协议,以及通过GRPO训练、经角色条件化驱动所有Agent的单一策略。在TravelPlanner上,采用Qwen3-8B的HiMAP-Travel达到52.78%的验证集和52.65%的测试集Final Pass Rate(FPR)。在模型、训练与工具完全相同的受控比较中,它比顺序式DeepTravel基线高出8.67个百分点。它还分别超出ATLAS 17.65个百分点、MTP 10.0个百分点。在FlexTravelBench多轮场景中,它取得44.34%(2轮)和37.42%(3轮)的FPR,同时通过并行化将延迟降低2.5倍。

HiMAP-Travel:面向长程受限旅行的分层多Agent规划
图1:HiMAP-Travel架构。Coordinator将查询投影为子目标 z d z_{d} 。并行Executor生成日计划 τ d \tau_{d} ,并通过全局状态 Σ \Sigma 进行同步。若约束被违反,议价协议(Bargaining Protocol)触发重新分配。