论文
Puffin-World:使用原生 3D 世界状态扩展统一多模式模型
Puffin-World: Scaling a Unified Multimodal Model with Native 3D World States
摘要
我们提出了 Puffin-World,这是一种统一的多模态架构,集成了物理理解、空间模拟以及 3D 世界生成和重建,无需依赖外部离线模块。为了可靠地构建 3D 世界并与之交互,我们的框架联合建模了三种原生世界状态:物理(重力场和纬度)、几何(深度)和外观(图像),以及支持多样化任务和灵活运动的统一全向相机表示。除了对这些状态进行建模之外,我们还引入了一种在未来框架中传播物理动力学的策略。通过将绝对相机属性置于现实世界中,Puffin-World 能够生成物理上一致且视觉上稳定的世界。我们进一步将外观和几何图形结合在一个生成过程中,共同合成每个未来视图并重建其底层几何图形。这种统一的范式支持需要跨多个任务协同的交错闭环应用程序,包括模拟和自校准的世界探索。为了将 Puffin-World 扩展到复杂的场景,我们构建了 Puffin-16M,其中包括 1500 万个视觉-语言-相机三元组和 100 万条具有各种挑战性运动的轨迹。为了促进该领域的进一步研究,我们发布了代码、模型和数据集。