论文
语言代理的政策和世界建模联合训练
Policy and World Modeling Co-Training for Language Agents
摘要
强化学习 (RL) 通过教导 大语言模型 (LLM) 代理哪些行为会带来高奖励来改进它们,但对这些行为对环境的影响几乎没有监督。世界建模 (WM) 可以填补这一空白,但现有方法通常需要单独的模拟器、额外的训练阶段或额外的推理时间计算。我们观察到 同策略 RL 卷展栏已经包含所需的信号:每个转换将一个动作与其生成的下一个观察结果配对。基于这一观察,我们提出了 PaW,一种策略和世界建模协同训练框架,它在 RL 期间向同一策略添加辅助 WM 监督,而不改变推理范式。为了使辅助 WM 监督信息丰富且稳定,PaW 引入了三个组件:基于动作熵的 WM 数据选择、耐噪声 WM 损失和奖励自适应损失平衡。对三个代理任务基准的实验表明,跨模型和 RL 算法比强 RL 基线有一致的改进。这些结果表明,标准强化学习的执行轨迹是语言代理训练的 WM 监督的实用来源。