论文

CAER:世界模型训练中的因果动作效应重加权

CAER: Causal Action Effect Reweighting for World Model Training

模型训练预训练

摘要

世界模型正在成为体现智能的核心基础设施,动作条件视频生成可以提供对智能体干预后场景如何演变的可控预测。然而,现有模型通常采用时空均匀均方误差进行训练,允许丰富的背景标记主导梯度,而稀疏的交互动态仍然未得到优化;这种统一的合身奖励的是重建外观,而不是学习行为如何改变世界。我们引入了因果行动效应重新加权(CAER),这是一种通用的训练范式,它将监督重新分配给那些预测未来受到行动因果影响的token。 CAER 对比模型自身的预测(有或没有动作条件),以在线定位这些标记,然后将所得效果图归一化为保留总系数质量的权重,并且仅在使用时进行更改。该在线信号不需要外部注释或离线预处理,避免了额外的数据处理时间,并随着模型和数据集大小自然缩放。跨异构动作条件世界模型任务的实验表明,CAER 收敛到比统一 MSE 训练更好的解决方案,并在生成视频的物理一致性、可控性和视觉质量方面得到持续改进。

CAER:世界模型训练中的因果动作效应重加权:论文配图
图1 空间环境研究中心概览。CAER 识别和重新加权在线上响应行动的指示,不附加外部说明。例子包括终端效应轨迹、相机轨迹、双臂动作和绘制地图。