论文

SmartMage:用于 3D 场景理解的动态模态编排

SmartMage: Dynamic Modality Orchestration for 3D Scene Understanding

摘要

理解 3D 场景是体现智能的基础,需要对来自多种模式(包括视觉和几何线索)的异构信息进行联合推理。然而,这些模式的相关性通常因查询而异。现有的多模态 大语言模型 (MLLM) 通常依赖于固定模态组合,忽略了依赖于查询的模态需求。这种僵化的设计可能会引入来自不相关模态的语义噪声,同时未充分利用信息丰富的模态,从而导致计算浪费和推理稀释。为了应对这些挑战,本文提出了 SmartMage,这是一种统一的 MLLM,可以动态编排异构模式以实现语义感知 3D 场景理解。具体来说,SmartMage 包含:(1)语义引导模态自适应路由(SMART)模块,该模块使用语义先验、文本模态对齐和模态质量来选择与任务相关的模态; (2) 模态感知门控专家 (MAGE) 模块,利用模态先验来指导专家激活,促进多模态推理的自适应专业化。根据经验,SmartMage 在五个 3D 场景理解基准测试中实现了最先进的性能,并在纯 RGB 视频理解基准测试中获得了有竞争力的结果。在我们的诊断基准 ScanFacet 中,任务被分为细粒度的语义类别,从而能够分析每种语义类型首选的模态组合。观察到的模态语义模式进一步证明了 SmartMage 的有效性。项目页面:https://yuecheong.github.io/SmartMage/。