论文
通过时间比率理解和缩小视频动作泛化差距
Understanding and Mitigating the Video-Action Generalization Gap via Temporal Ratio
摘要
生成视频基础模型表现出强大的组合先验,但世界动作模型(WAM)和视频动作模型(VAM)在对机器人动作数据进行微调后通常会丢失这些先验。我们将这种差异称为视频动作泛化差距。在本文中,我们通过评估 VAM 的综合设计空间来系统地研究这一差距,证明标准设计选择不会产生新的解释模式。为了解释这种行为,我们引入了时间比率(TR),这是一种基于注意力的度量,用于衡量动作头对相对于锚定当前帧的未来预测潜在轨迹的依赖程度。 TR 有两个关键属性:首先,模型对未来预测潜在状态的结构依赖(通过 TR 测量)充当其组合泛化能力的预测器;其次,它本身会根据任务阶段而波动,在计划期间将注意力转移到未来帧,并恢复到当前帧以进行精确的操作。最后,基于这些发现,我们提出了一种推理时间自适应指导方法,该方法利用这种内在的特征注意模式,在策略依赖于未来预测轨迹时精确地动态放大组合性视频条件信号。根据 LIBERO 基准和实际任务进行评估,我们的方法缩小了 OOD-ID 组合泛化差距。更多详细信息:https://umishra.me/temporal-ratio/