论文
以时间为中心的 SIGReg 改进了机器人策略学习的 LeWorldModel 表示
Temporally Centered SIGReg Improves LeWorldModel Representations for Robot Policy Learning
摘要
LeWorldModel (LeWM) 的最新工作表明,草图各向同性高斯正则化器 (SIGReg) 通过将潜在表示朝各向同性高斯正则化,能够从像素进行稳定的端到端世界模型学习。虽然对潜在空间规划有效,但 Raw LeWM 学习的表示不太适合下游机器人策略学习。在本文中,通过蒙特卡罗分析,我们表明原始 LeWM 目标将方差分配偏向时间持久分量,从而抑制时间中心残差的方差。与此分析一致,经过训练的原始 LeWM 表示表现出残余变化受到抑制,机器人状态和动力学的可解码性降低,特别是对于机器人操作至关重要的夹具动力学。为了解决这个问题,我们将 SIGReg 应用于时间中心残差而不是整个潜在表示。这个简单的改变解耦了持久方差分配和剩余方差分配,同时保留了有效的抗崩溃属性。在 LIBERO 基准上,我们的方法将 Goal 套件上的下游策略成功率提高了 1.66 倍,并将所有套件的平均成功率从 63.6% 提高到 83.8%。在没有外部预训练的情况下,它的性能也优于从头开始训练的扩散策略和预训练的 OpenVLA 基线。这些结果将 Raw LeWM 的方差分配偏差与下游策略差距联系起来,并表明解耦持久性和剩余变量会产生更适合下游机器人策略学习的表示。