论文
解开视觉-触觉远见:世界行动模型的 Oracle 引导界面发现
Disentangling Visuo-Tactile Foresight: Oracle-Guided Interface Discovery for World Action Models
摘要
富含接触的操纵仍然具有挑战性,因为成功的控制取决于物理交互线索,而这些线索通常仅通过视觉很难观察到。最近的触觉世界行动模型联合模拟了未来的视觉观察和触觉信号来指导行动的产生,但如何构建这样的未来以供行动专家有效使用仍然没有得到充分探索。用学习的世界行动模型直接研究这个问题是很困难的,因为端到端行为纠缠着物理上无效的视觉未来、不可靠的预测、不准确或跨模式不一致的触觉预测,以及不可读的未来到行动界面。为了使该界面可独立研究,我们引入了 Oracle Visuo-Tactile Foresight (OVTF),这是一个受控框架,可根据模拟验证的成功轨迹提供配对的 RGB 和触觉未来。通过修复未来的提供者,OVTF 隔离了接口并提出了一个更清晰的问题:如果未来是成功的并且物理上可执行的,那么什么样的表示允许行动专家吸收其好处?在OVTF中,我们提出了非对称相位局部未来记忆(AFM),其中视觉记忆读取未来视觉,每个触觉记忆共同关注自己的触觉流和相位对齐的未来视觉,并且交叉触觉访问被阻止。我们将 AFM 与模态隔离未来记忆 (IFM) 进行比较,后者消除了视觉到触觉的访问并独立处理每个未来模态。在 UniVTAC 模拟基准的七项任务中,AFM 平均成功率为 32.0%,而 IFM 为 23.7%,UniVTAC-ACT 为 14.9%。这种受控比较表明,选择性相位对齐视觉触觉路由比完全模态隔离提供了更可行的未来到行动的桥梁。