论文
PriorZero:连接语言先验和决策世界模型
PriorZero: Bridging Language Priors and World Models for Decision Making
摘要
利用 大语言模型 (LLM) 丰富的世界知识来增强强化学习 (RL) 代理,为通向通用智能提供了一条有希望的道路。然而,基本的先验动力学不匹配阻碍了现有方法:静态 LLM 知识无法直接适应长视野任务的复杂过渡动力学。使用 LLM 先验作为固定策略限制了探索多样性,因为先验对特定环境的动态是盲目的;而端到端的 微调 则存在优化不稳定和贡献分配问题。为了弥补这一差距,我们提出了 PriorZero,这是一个统一的框架,通过解耦的采样轨迹训练设计将 LLM 派生的概念先验集成到基于世界模型的规划中。在采样轨迹期间,一种新颖的根先验注入机制仅在蒙特卡罗树搜索(MCTS)的根节点结合了 LLM 先验,将搜索重点放在语义上有希望的动作上,同时保留世界模型的深度前瞻能力。在训练过程中,PriorZero 将世界模型学习与 LLM 适应解耦:世界模型根据交互数据不断完善,共同改进其动态、策略和价值预测,然后利用其价值估计通过交替优化为稳定的 LLM 微调 提供细粒度的贡献分配信号。跨不同基准的实验,包括 Jericho 中基于文本的冒险游戏和 BabyAI 中的遵循指令的网格世界任务,表明 PriorZero 持续提高探索效率和渐近性能,为 LLM 授权的决策建立一个有前途的框架。我们的代码可在 https://github.com/opendilab/LightZero 获取。