论文

LLM 代理中的世界模型和策略如何组成?光谱和行为联合账户

How do World Models and Policies Compose in LLM Agents? A Joint Spectral and Behavioral Account

模型评测模型行为与机制分析

摘要

LLM 代理如何了解他们所处的环境并掌握其中设置的任务?通过结合 world-模型训练(下一状态预测)和策略训练(奖励最大化)的受控实验,我们研究了这个问题。我们通过附加参数更新来剖析生成的模型。从几何角度来看,我们发现有效的世界模型更新是低秩的,并且与策略更新共享输入特征子空间,同时写入几乎正交的输出方向,无论是单独训练还是顺序训练。然而,我们发现,在预测干预中,当删除世界模型的主导输入方向时,顺序更新比单独的策略强化学习具有更强的鲁棒性,这表明它已经学习了替代输入路径。在行为上,我们发现顺序训练的智能体探索更广泛的状态和动作。基于此,我们要问:政策训练是否能够尽可能地保存世界知识?我们通过基于几何激励输入基础的 无需训练 合并以及策略 RL 期间的在线世界模型损失来探讨这一点,并显示两者都比未经处理的基线有所改善。我们的研究结果表明,世界知识和任务导向能力可以以几何互补的形式学习,未来的 后训练 管道应该考虑如何最好地设计它们之间的接口。