论文
内化未来:面向世界模型规划的统一智能体训练范式
Internalizing the Future: A Unified Agentic Training Paradigm for World Model Planning
摘要
大语言模型(LLM)智能体已展示序列决策的强能力——但在长程任务中本质仍是反应式的。不同于人类用“如果-那么”推理在承诺前评估潜在计划——标准智能体缺乏模拟未来结果的内部世界模型。因此——我们提议通过训练单一自回归模型言语化前瞻状态rollout与计划条件化的成功估计(Q值的文本类比)来内化未来感知规划。关键的是——我们识别格式-能力缺口:仅在后训练中对前瞻踪迹微调导致对先见的表面模仿——而无真正预测锚定。为弥合该缺口——我们引入三阶段训练范式:(i) 世界模型智能体中期训练(WM-AMT)把潜在预测能力注入策略;(ii) 格式引出SFT(FE-SFT)结构化该注入能力;(iii) 先见条件化强化学习(FC-RL)精化生成仿真的校准与效用。在搜索与数学推理任务上评估——我们的方法持续超越其他训练基线。结果表明LLM智能体中有效的内部世界建模需要能力优先的训练管线——以达成锚定且校准的先见。
