论文

Being-H0.7:来自自我中心视频的潜在世界动作模型

Being-H0.7: A Latent World-Action Model from Egocentric Videos

模型训练预训练

摘要

视觉语言动作模型(VLA)通过将多模态观察和语言指令直接映射到动作来实现先进的通用机器人控制,但稀疏动作监督通常鼓励快捷映射,而不是动态、接触和任务进度的表示。最近的世界动作模型通过视频采样轨迹引入了未来预测,但像素空间预测是一种昂贵且间接的控制基础,因为它可能会建模与动作生成无关的视觉细节,并引入大量的训练或推理开销。我们提出了 Being-H0.7,这是一种潜在的世界行动模型,它将未来感知推理引入 VLA 式策略中,而无需生成未来框架。 Being-H0.7 在感知和动作之间插入可学习的潜在查询作为紧凑的推理接口,并使用面向未来的双分支设计来训练它们:可部署的先验分支从当前上下文推断潜在状态,而仅训练的后分支用来自未来观察的嵌入替换查询。在潜在推理空间上联合对齐两个分支,可以使先前的分支仅根据当前的观察来推理出未来感知的、对行动有用的结构。推理时,Being-H0.7 丢弃后分支并且不执行视觉采样轨迹。六个模拟基准和各种现实世界任务的实验表明,Being-H0.7 实现了最先进的或可比的性能,将世界模型的预测优势与直接 VLA 策略的效率和可部署性相结合。