论文

特权远见蒸馏:世界行动模型的零成本未来修正

Privileged Foresight Distillation: Zero-Cost Future Correction for World Action Models

摘要

世界动作模型在训练期间共同预测未来的视频和动作,提出了一个关于未来预测分支实际上扮演什么角色的悬而未决的问题。最近的一项发现表明,可以在推理时删除该分支,而对常见操作基准几乎没有损失,这表明未来的信息可能仅充当共享视觉主干上的正则化器。相反,我们建议联合训练会引发一种以行动为条件的修正,这种修正优先考虑未来的观察结果,对行动去噪施加影响,而仅当前的策略只能部分捕获这种修正。为了使描述更加精确,我们将特权前见表述为动作去噪方向上的残差——模型在给定真实未来的情况下预测的内容与仅在当前帧下预测的内容之间的差异——并引入\emph{特权前见蒸馏 (PFD)},它将这个残差从训练时的教师转移到仅针对当前学生的小适配器中。教师和学生共享相同的骨干网,仅在视频标记上的注意力掩模上有所不同;未来的视频永远不会在推理中生成。对照实验证实,这种增益反映了真正的未来条件修正,而不是容量或正则化的副作用。根据经验,PFD 在 LIBERO 和 RoboTwin 操作基准上实现了一致的改进,同时以可忽略的附加延迟保留了当前的推理接口。这种观点重新定义了未来信息在世界行动模型中的作用:不是作为预测的目标,也不是作为吸收的正则化器,而是作为要蒸馏的可压缩修正。