论文

OnlineWM:因果关系感知主动在线学习,用于有效的世界建模

OnlineWM: Causality-Aware Active Online Learning for Effective World Modeling

模型训练监督微调与指令调优

摘要

生成世界模型旨在预测以动作为条件的未来状态,其中动作可控性是可靠动力学建模的基础。虽然最近的努力利用模拟器生成的数据来增强这种能力,但现有的训练管道面临两个基本限制。首先,静态离线数据收集会导致训练集与模型不断演变的错误模式之间的分布不一致,无法解决动态预测仍然不可靠的关键长尾场景。其次,最小化观察差异的标准目标通常会鼓励模型利用虚假相关性,而不是捕捉潜在的行动-效果因果关系。为了解决这些限制,我们提出了 OnlineWM,这是一种在线训练框架,可以通过主动模拟器交互和因果关系感知优化来不断改进世界建模。 OnlineWM 引入了两项关键创新: (1) 主动在线学习:OnlineWM 不使用固定数据集,而是自适应地查询模拟器以查找针对模型当前预测弱点的新交互序列,从而确保高效的数据采集。 (2)因果感知微调:我们提出了一种反事实学习策略,对比相同状态下不同动作的结果,迫使模型将状态转换归因于特定动作而不是周围环境的演变,从而将其预测建立在可靠的因果机制上。通过将主动数据采集与因果优化相结合,OnlineWM 建立了闭环细化流​​程,确保模型对不同场景具有鲁棒性,并且因果归因精确。大量实验表明,OnlineWM 显着增强了动作可控性,并有效推广到未见过的领域。