论文
如何训练你的世界模型:微调vs RAG
How To Train Your World Model: Fine-tuning vs RAG for LM-based World Modeling
摘要
世界模型(WM)模拟环境转移动力学,使智能体能对动作后果做规划。在文本环境中,微调语言模型充当WM已成为主导范式。然而尽管检索增强生成(RAG)等非参数方法广获成功,面向LM世界建模的检索仍未被充分探索。我们在横跨具身、网页导航与社会情境的五个多样环境中系统评估LM世界建模的微调与RAG路线。研究显示:微调常优于RAG,微调WM使智能体在15/20设置上获得更高奖励;两种构建范式都受益于更多样化的探索,但RAG路线更省数据,而微调路线从扩展经验量中获得不成比例的收益。聚焦RAG型WM,我们设计用反事实干预估计检索阶段错误率的程序,发现检索器持续从经验缓冲中取出次优转移;为解决这一缺陷,我们研究多种查询重写策略,证明分层方法优于传统检索管道。最后我们把发现组合成混合世界建模系统:参数化捕捉核心环境动力学,同时学习依赖主动维护记忆库的检索。混合系统在多环境多模型上一致优于其他方法,展示了该方法的鲁棒性与发现的适用性。