论文
IronMan:信息受限的视频动作学习
IronMan: Information-Constrained Video-Action Learning for Robot Manipulation
摘要
视频动作模型 (VAM) 将视觉动力学建模与机器人操作的动作生成结合起来。然而,视频表示并不自然适合动作生成,因为将动作策略暴露于过多的视觉细节可能会损害其泛化能力。因此,我们引入了 IronMan(Information-constRained video-action Learning for robots MANipulation),这是一个基于信息瓶颈原理构建的鲁棒视频动作学习框架。该框架的核心原则是施加信息约束,抑制不相关的视觉信息,同时保留与动作相关的动态线索。 IronMan 采用了一种动态感知瓶颈,将嘈杂、纠缠的单步视频特征提炼成紧凑的世界表示。广泛的模拟和真实实验证明了强大的分布内 (ID) 性能和分布外 (OOD) 鲁棒性,同时保持高效推理。 IronMan 在 LIBERO 上实现了 99.0% 的成功率,在 RoboTwin clean2clean 上实现了 79.4% 的成功率,优于所有评估的基准。在 OOD 转换下,IronMan 在 LIBERO-Plus 上实现了 79.1% 的成功率,超出了最强基线 10.4 个百分点。项目页面:https://youngsoul0731.github.io/ironman-project-page/
