论文
3D-Mix for VLA:即插即用模块,用于将基于 VGGT 的 3D 信息集成到视觉-语言-动作模型中
3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 模型利用多模态 大语言模型 (MLLM) 进行机器人控制,但最近的研究表明,由于主要在 2D 数据上进行训练,MLLM 表现出有限的空间智能,导致操作任务的 3D 感知不足。虽然最近的方法结合了 VGGT 等专门的 3D 视觉模型来增强空间理解,但它们在没有系统研究的情况下采用了不同的集成机制,导致最佳融合策略不清楚。我们在标准化基准上对九种 VGGT 集成方案进行了全面的试点研究,发现语义条件门控融合(基于任务上下文自适应地平衡 2D 语义和 3D 几何特征)在我们的试点研究中的所有九种评估的融合方案中实现了最强的性能。我们推出了 3D-Mix,这是一个即插即用的模块,可以集成到不同的 VLA 架构(GR00T 风格和 $π$ 风格)中,而无需修改现有的 MLLM 或动作专家组件。在 SIMPLER 和 LIBERO 上对六个 MLLM 系列(九个模型变体,2B--8B 参数)进行的实验表明,3D-Mix 提供了一致的性能增益,在所有九个 GR00T 型变体的域外 (OOD) SIMPLER 基准上平均 +7.0%,建立了增强 VLA 系统中空间智能的原则性方法。