论文
WorldBagel:揭示视觉-语言-动作-世界建模的统一多模态模型的力量
WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling
摘要
世界模型旨在以支持感知、推理和行动的方式捕获环境动态,并且最近已成为视觉-语言-行动-世界(VLAW)建模的中心方向。与此同时,统一的视觉语言模型已经表现出了强大的多模式生成能力,但它们作为世界模型的潜力仍未得到充分开发。在这项工作中,我们引入了 \texttt{WorldBagel},这是一个基于现代多模态统一模型 BAGEL 构建的统一 VLAW 框架,并用它来系统地研究统一在世界建模中的作用。在多任务机器人操作和跨域实验中,\texttt{WorldBagel} 始终优于特定任务的替代方案,并学习更加结构化且在语义上与视觉和语言上下文一致的动作表示。 LIBERO、Language Table 和 Franka 上的实验表明,统一不仅是架构上的便利,也是学习有效 VLAW 模型的关键因素,从而获得一致的经验收益和对多模态世界建模的更深入见解。代码和模型检查点将在接受后发布。