论文

提取 RGB 可以恢复的内容:纯 RGB 视觉语言模型的特权 3D 证据

Distill What RGB Can Recover: Privileged 3D Evidence for RGB-Only Vision-Language Models

摘要

3D 场景理解需要对实体存在、空间布局和对象关系进行推理,但仅 RGB 图像通常无法提供足够的 3D 线索。现有的 3D-VLM 通常依赖于推理时的深度或 3D 位置感知输入,从而引入额外的采集、重建或注释成本,从而限制了仅 RGB 的部署。因此,我们研究如何将训练时 3D 证据转换为仅 RGB 推理下保留的空间推理能力。我们提出了一个特权证据 蒸馏 框架,该框架通过统一的证据接口和受控残留注入构建可蒸馏的教师,并将其知识传输给通过 logits 和结构化表示 蒸馏 仅接收 RGB 图像和问题的可部署学生。为了避免模仿 RGB 不支持的教师信号,我们进一步引入了证据敏感性引导的 蒸馏,它使用损坏的证据来识别高度依赖证据的目标并降低其监督权重。我们还根据匹配的基线、教师和学生定义了可恢复性分解,将特权收益分为 RGB 可恢复改进和剩余教师优势。在四个基准测试中,教师在比较方法中的 11 个报告指标中的 7 个上取得了最佳结果。仅使用 RGB 的学生在所有 11 个指标上均优于其匹配基线,包括 10.4 ScanQA CIDEr 和 19.1 Scan2Cap CIDEr@0.5 的增益,而无需额外的推理时间输入。这些结果验证了训练时间特权 3D 证据 蒸馏 对于教师表现和可部署的纯 RGB 空间推理的有效性。另外,我们匹配的基线教师学生分析描述了跨证据类型和空间技能的特权增益转移。