论文

3DThinkVLA:通过 3D 思维引导协同训练为视觉-语言-动作模型赋予潜在 3D 先验

3DThinkVLA: Endowing Vision-Language-Action Models with Latent 3D Priors via 3D-Thinking-Guided Co-training

摘要

我们提出了一个 3D 思维引导的协同训练框架,使视觉-语言-动作 (VLA) 模型能够在动作预测期间隐式执行 3D 空间推理。我们的核心见解是,3D 几何感知和 3D 空间推理是不同的功能,可以在不同的特征层次结构中分离和注入。在训练期间,三个紧密耦合的组件主要在潜在空间内协同工作:(1)为了获得几何先验,潜在的 3D 几何感知模块将中间视觉特征与 3D 基础模型对齐,获取底层几何线索,而无需对 VLM 主干进行架构修改。 (2) 作为补充,在线 3D 推理 蒸馏 模块通过共享推理锚标记减轻了提示引起的推理差距。在 3D VLM 协同训练期间,该锚点作为第一个输出标记发出,以稳健地编码空间先验。在 VLA 训练期间,它作为插入任务和动作指令之间的输入词元,将高级空间思维从明确的教师推理提示转移到学生动作提示,而无需生成思维链文本。 (3) 然后,这些解开的几何和推理特征通过空间增强的动作集成来统一,该集成将它们作为分层空间条件共同注入到动作查询标记中,以防止动作捷径。在部署时,我们的方法仅保留其轻量级适配器来执行隐式 3D 推理,丢弃 3D 基础模型和用于监督的教师分支。因此,它纯粹在 2D 图像上运行,无需 3D 传感器、外部模型或显式文本生成,同时防止预训练 VLM 的灾难性遗忘,在 LIBERO、LIBERO-PLUS、SimplerEnv 和现实世界操作任务上实现最先进的性能。