论文
Qwen-3D:用于空间理解的通用 3D 视觉语言模型
Qwen-3D: A Generalist 3D Vision-Language Model for Spatial Understanding
摘要
大型多模态模型 (LMM) 在图像和短视频方面取得了显着的成功,但由于以帧为中心的标记化和有限的上下文窗口,将它们扩展到长视频仍然具有挑战性。 3D 几何为视觉流提供了一种自然的压缩机制:深度和相机姿势使来自多个视图和时间步长的观察结果能够融合成持久的、与世界一致的表示。虽然最近的 3D LMM 利用几何感知表示来改进空间推理,但它们在基础和分割任务方面仍然落后于专业 3D 感知系统。我们认为一个关键的限制是几何感知解码:现有方法通过语言标记、提案选择或轻量级基础查询来传达 3D 预测,从而在语言推理和密集几何预测之间造成瓶颈。基于这些见解,我们引入了 Qwen-3D,这是一种几何感知的 LMM,它使用多视图几何线索压缩 Qwen 主干内的视觉信息,从而在静态场景上实现高效的长视野视觉推理。 Qwen-3D 通过 3D 旋转位置嵌入增强视觉标记,允许注意力直接在 3D 场景空间中操作,而不是跨独立图像帧操作,从而促进可扩展的跨视图和时间推理。为了连接语言和几何,Qwen-3D 采用了基于查询的分割解码器,可将语言直接置于底层 3D 场景表示中,统一图像和视频中的参考基础、实例分割和视觉问答。在一系列不同的基准测试中,Qwen-3D 超越了现有的 3D LMM,并优于多个大型专有 2D 模型。值得注意的是,Qwen-3D 通过对 2D 和 3D 数据进行联合训练,实现了这些改进,同时在标准 2D 视觉语言基准上保持了强劲的性能。