论文

超越单一专家:协调 MLLM 中的不同视觉先验以实现空间理解

Beyond Single Expert: Harmonizing Diverse Visual Priors in MLLMs for Spatial Understanding

应用与实践视觉感知与空间理解

摘要

多模态 大语言模型 (MLLM) 在空间理解方面展现出了巨大的前景。现有的工作通常结合从预先训练的基础模型中提取的先验知识,以进一步增强 MLLM 的空间意识。在本文中,我们首先揭示了当将不同的基础模型集成到 MLLM 中时,不同的模型提供了有益于不同任务的互补空间先验。受此启发,我们提出了 $\textbf{ViPS}$,一种新颖的多模型先验框架,旨在充分释放将来自不同模型的多个 $\textbf{Vi}$sual $\textbf{P}$rior 合并到 MLLM 中的潜力,以实现 $\textbf{S}$ 空间理解。具体来说,ViPS 引入了高效先验代理,以最小的推理开销生成多个基础先验,并引入动态先验融合机制,以实现协调且上下文感知的先验融合和来自先验代理的注入。大量实验表明,ViPS 成功地协调了不同的视觉先验,在多个复杂的空间推理和 3D 空间理解基准上建立了新的最先进的性能。项目页面:https://visual-ai.github.io/vips