论文

Action Forcing:从无标签视频恢复世界模型控制信号

Action Forcing: Training World Models on Unsupervised Video by Recovering Underlying Egomotion Bases

模型训练合成数据

摘要

需要同步动作注释来训练可控的世界模型,而这些数据集仍然难以捉摸。现有的方法利用带有校准传感器的带仪器的平台、昂贵的手动注释或缺乏基础的潜在作用模型。相反,我们通过恢复(无需训练)数据衍生的自我运动基础,将普通的未标记视频转换为动作监督的训练数据。我们跟踪帧间的像素位移,并利用自我运动引起的重复相干结构来直接获取具有实际动作对应的控制信号。使用主成分分析这样简单的方法执行此操作,我们发现主要成分提供带符号的、可扩展的和可组合的油门-偏航控制,尽管该方法只能恢复数据中表示的运动轴。为了防止大容量视频 DiT 利用像素级监督,在线潜空间评论器从冻结的解码器—跟踪器—PCA(主成分分析)教师进行蒸馏,而不通过解码器或跟踪器进行反向传播。最后,我们批评使用视频生成指标来评估 WM,并介绍一个替代的、无参考评估方法的示例。我们测量 可控性、合理性、conjuring(凭空创造物体)和 几何完整性,揭示传统视频指标遗漏的故障。我们表明,大多数基线遵循熟悉的行动方向,但很难扭转或保持静止。我们的模型可以处理这两个问题,同时保留组合控制和生成质量。尽管向后动作少于训练数据的 1\%$,但我们发现模型可以学习反向、线性缩放其响应,并通过转向来组合油门,所有这些都只需通过具有实际动作对应的动作空间进行学习即可。

原始与符号反转指令的训练期余弦一致性,用于检验模型是否响应控制信号。
图2(图注摘要):原始与符号反转指令的训练期余弦一致性,用于检验模型是否响应控制信号。