论文

多轮长期规划的物理原理:通过单教师和多教师 同策略 Agentic 蒸馏 从 预训练 到 后训练

The Physics of Multi-Turn Long-Horizon Planning: From Pre-training to Post-training via Single- and Multi-Teacher On-Policy Agentic Distillation

摘要

多轮长期规划对于基础模型智能体至关重要,但如何从根本上改进它仍不清楚。现有模型是根据不可控且不透明的互联网数据进行训练的,因此很难确定规划能力是如何获取、形成和整合的。为了应对这一挑战,我们引入了一个统一且受控的多圈环境,可以实现精确控制。它允许系统地研究三个阶段的长期规划。 (1) 预训练期间规划能力获取。我们研究数据格式、分布和质量。通过 CoT 状态转换建模的显式世界模型构建可产生更强的长期泛化能力。仅凭原子技能不足以进行组合概括,而少量的长期数据就可以了。此外,次优轨迹会严重损害性能,因为错误会随着时间的推移而放大。 (2) 通过GRPO和OPD 后训练进行规划能力塑造。通过相互信息,我们将一般规划模式与特定任务的规划知识区分开来。对于规划模式,我们确定了 后训练 的三个应用区域:不必要的、有效的和不受支持的。在低质量和长视野设置下,OPD 比 GRPO 具有更广泛的有效区域,因为它提供了更一致的更新方向。对于规划知识,从具有不同知识的教师那里提炼出看不见的程序可能会损害学生先前的世界建模,而不会完全建立新知识。 (3)通过MOPD 后训练进行规划能力整合。我们展示了多教师 同策略 蒸馏 (MOPD) 通过跨环境融合到共享规划模式来集成功能。兼容的模式可以实现跨环境泛化,部分共享的模式支持持续学习,而完全冲突的模式会造成严重的干扰。