论文

使用 CoT 将 3D 空间推理提炼为轻量级视觉语言模型

Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

摘要

LLaVA-3D 等大型 3D 视觉语言模型 (VLM) 提供强大的空间推理能力,但由于计算成本较高而难以部署。我们提出了一个 知识蒸馏 框架,将空间推理从 7B 教师模型转移到 2.29B 学生模型。我们的方法将推理延迟降低了 8.7 倍,模型大小减少了 3 倍,同时保留了教师 54-72% 的性能。该框架利用 VGGT 作为视觉编码器和具有不确定性感知损失权重的多任务 蒸馏 管道。为了在没有思想链 (CoT) 数据的情况下改进推理,我们引入了“隐藏 CoT”:可学习的潜在标记,在答案生成之前充当内部暂存器。这是潜在暂存器推理在精炼 3D VLM 中的首次使用。学生模型联合执行空间描述、深度估计和对象检测。 ScanNet 和 3D-FRONT 上的实验显示出强大的空间理解能力,在接近和接触任务上达到 68-72% 的准确率。我们的框架可在资源受限的平台上实现高效的 3D 场景 QA。