论文
$ω$-EVA:利用潜在的交互式世界模型进行设想、验证和行动
$ω$-EVA: Envision, Verify, and Act with Latent Interactive World Models
摘要
体现的政策通常将当前的观察结果直接映射到行动,而隐含地留下候选行动的后果。世界模型提供预测性监督、表征或外部模拟,但很少让政策在采取行动之前检查其自身提案的想象结果。我们引入$ω$-EVA,一种潜在的交互式世界模型,它实现了用于生成具体动作的设想-验证-行动循环。其三阶段框架学习动作条件的潜在动态,在动态感知的视觉表示上训练语言条件的流策略,并通过世界模型反馈策略的建议。三分支细化器共同对当前状态、提议条件的未来以及提议的行动进行推理,以产生最终的行动块。由于结果推理仍然存在于潜在特征空间中,$ω$-EVA 避免在推理时生成未来的视频。对不同单臂、双手、长视野和扰动模拟设置的评估表明,完整的交互管道持续改进了提案策略,而潜在诊断表明了有意义的以行动为条件的未来结构。凭借大约 1.2B 参数且无需额外的机器人数据预训练,$ω$-EVA 展示了紧凑且有竞争力的性能-规模-数据权衡,使世界模型成为主动动作反馈模块而不是被动预测器。