论文
行动的正确未来:学习世界行动模型中与行动相关的预测状态
The Right Future for Action: Learning Action-Relevant Predictive States in World Action Models
摘要
无生成世界动作模型 (WAM) 在训练期间保留未来视频预测,但在推理时根据内部视频特征进行操作,从而不清楚这些特征应保留哪些内容以进行控制。我们的表示诊断表明,具有更可预测的未来变化的表示并不需要使线性动作解码变得更容易。观察到的未来变化提供了超越当前的额外动作信息,并且线性可读的动作信息在空间上集中。这些发现激发了动作相关预测状态 (ARPS),这是视频和动作专家之间的一个紧凑的预测接口。 ARPS 使用地平线条件状态预测器将中间视频特征聚合成紧凑状态,为动作专家提供所有视觉上下文。未来表征监督训练该状态的不同部分来预测未来不同时间的视觉表征,以及它们相对于当前的变化。在推理时,监督分支被删除,动作专家仅使用根据当前观察计算出的学习预测状态。受控消融表明,未来的监管大大提高了分布转移下的泛化能力。 ARPS 在 LIBERO 上取得了 99.2% 的成功率,无需适配转移到 LIBERO-Plus,达到 87.3%,超过 Fast-WAM 39.2 个百分点。