论文
使远见可行:重新调整世界行动模型中的表征一致性
Making Foresight Actionable: Repurposing Representation Alignment in World Action Models
摘要
世界动作模型(WAM)通过使用视频生成模型在产生控制动作之前对未来场景演化进行建模,为机器人操纵提供了一条有前途的途径。然而,我们的经验观察揭示了一个现象:生成合理的视觉未来并不总是保证提取准确的动作。为了诊断这种失败,我们进行了行动头注意力分析和因果干预。我们发现动作解码器无法关注与任务相关的交互区域,并且对与任务无关的区域的扰动仍然敏感。这揭示了表示不匹配:针对视觉重建优化的隐藏状态本质上并不是以对底层动作控制有用的形式组织的。在本文中,我们提出了 AGRA,一种基于动作的表示对齐目标,它通过将中间视频扩散特征与来自基础视觉编码器的空间连贯语义表示对齐来规范世界动作界面。我们在现实世界的操作任务上评估 AGRA。实验表明,AGRA 使世界模型表示更加以动作为基础:通过将动作解码器集中在正确的交互区域,它提高了对象定位的准确性和可供性理解,并使策略对任务无关区域的扰动更加鲁棒。因此,AGRA 相对于基线世界行动模型不断提高分布内性能和分布外泛化能力。