论文

SpaR3D-MoE:稀疏视图的自适应 3D 空间推理与几何归纳专家的混合

SpaR3D-MoE: Adaptive 3D Spatial Reasoning from Sparse Views Meets Geometry-Inductive Mixture-of-Experts

摘要

最近的多模态 大语言模型 (MLLM) 努力弥合 2D 语义理解和 3D 空间几何之间的表征差距。现有的 3D 感知模型要么依赖于昂贵的 3D 特定数据,要么利用启发式采样和整体浅层融合的纯 RGB 输入,这分别会破坏基本的时空连接性并引发跨不同空间任务的模态争用。为了克服这些瓶颈,我们引入了 SpaR3D-MoE,这是一种端到端框架,通过为 MLLM 配备仅来自稀疏 RGB 输入的几何感知功能,可以实现自适应空间推理。首先,我们提出了一种自适应时空流形采样机制,该机制构建几何感知时空图​​来提取信息关键帧,有效减少序列冗余,同时保留场景的拓扑连接性。其次,我们引入了由指令姿势感知路由器驱动的异构几何归纳专家混合,它自适应地将多模态词元路由给专业专家,解决了整体融合中固有的跨模态争用。在 VSI-Bench、ScanQA 和 SQA3D 上进行的大量实验表明,我们的方法实现了最先进的性能。值得注意的是,SpaR3D-MoE 在 VSI-Bench 上取得了最高平均分 63.5 分,比最强基线高出 7.8 绝对分,同时在路线规划和相对方向任务中相对改进分别为 35.4% 和 51.4%。