论文
MASER:用于体现 3D 空间智能的模态自适应专业路由
MASER: Modality-Adaptive Specialist Routing for Embodied 3D Spatial Intelligence
摘要
在 3D 环境中,具体代理通过自然语言、RGB 图像、点云、深度图和相机姿势等多种模态的混合推理来回答空间相关问题。现有的视觉语言模型 (VLM) 在单一模式上进行了微调。这完全忽略了问题语义,它可能支持与微调模态不同的模态。为了解决这个问题,我们提出了 MASER(模态自适应特殊路由),这是一个轻量级框架,可训练共享 VLM 主干的五种不同模态适配器,并学习神经路由策略,在推理过程中根据问题选择最佳适配器。我们用冻结的句子 Transformer 对每个问题进行编码,并将嵌入传递给在预言机适配器精度标签上训练的小型多层感知器 (MLP)。我们通过 Open3D-VQA 基准评估我们的方法,我们的评估表明没有一种单一模式是普遍最佳的——点云答案在 51.5% 的情况下是最好的。 MASER 路由具有 51.3% 的预言机一致性,优于随机森林消融 (43.5%),每个问题仅调用一个适配器。