论文
扩展体现智能的专家混合视频预训练
Scaling Mixture-of-Experts Video Pretraining for Embodied Intelligence
摘要
尽管机器人控制最近前景广阔,但视频生成模型由于主要关注内容创建而遭受领域不匹配的困扰。例如,他们的设计本质上优先考虑视觉保真度和创造力,而不是计算效率和物理真实感。在这项工作中,我们提出了 LingBot-Video,这是一种专门为体现智能量身定制的基于 DiT 的视频预训练范例。从架构的角度来看,我们采用混合专家(MoE)而不是密集的框架来实现建模能力和推理效率之间的更好权衡,并设法从头开始扩展。从数据角度来看,我们构建了一个数据分析引擎,通过广泛的面向机器人的镜头增强标准互联网视频,包括操纵、导航和以自我为中心的视角,以使基本模型具备对行为和世界动态的内在理解。从训练的角度来看,我们开发了一个多维度的奖励系统,以强化身体理性和任务完成方面的一致性,超越美学、提示跟随性和动作一致性等标准标准。综合评估验证了其作为视频基础模型的性能和效率。我们将 LingBot-Video 作为首个大型开源 MoE 视频基础模型贡献给社区,这是连接数字创造力和物理驱动的开创性努力。