论文
Enfold:将世界模型想象力折叠成预测表示,以实现超高效的具体控制
Enfold: Folding World Model Imagination into Predictive Representations for Ultra-Efficient Embodied Control
摘要
世界生成模型通常通过它们生成的内容来使用:渲染的未来、视频条件动作或由昂贵的生成分支计算的潜在上下文。我们认为,他们更可重用的资产是构建未来的计算。当生成器将腐败的未来转变为连贯的轨迹时,其中间状态会组织外观、空间布局和跨抽象级别的交互。这种未来生成计算能否内化为仅从现在推断出的表示形式?我们提出了 Enfold,它将计算转换为根据当前视觉上下文和语言指令预测的表示。在训练期间,当生成器处理观察到的未来时暴露的多级状态监督仅当前的编码器。学习到的表示被反馈到条件下一代,并由任务头读取,而不允许任务梯度重塑编码器。部署时,动作预测不再执行生成器。在 LIBERO、RoboTwin2.0 和真实机器人任务中,Enfold 支持强大的控制,同时相对于 Fast--WAM 减少动作延迟 3.7倍,Enfold-Flash 达到 10.1倍。代表性分析表明,它抑制了令人讨厌的变化,并优先捕获较长时间内出现的变化。当当前场景因人为干预而改变时,生成的延续和执行的动作都会适应,这与固定轨迹重放不一致。这些结果将世界生成器重新塑造为预测控制表示的来源:如果它的内部结构可以包含在现在中,那么它的未来不需要在每一步都实现。