论文

Lens3D:用于细粒度 3D 理解的目标条件视觉焦点

Lens3D: Target-Conditioned Visual Foveation for Fine-Grained 3D Understanding

应用与实践视觉感知与空间理解

摘要

现有的 3D 大语言模型经常忽略细粒度的属性和视觉上不太显着的对象和部分,即使场景视频中存在相关证据也是如此。我们引入 Lens3D,通过外部视觉辅助和知识转移来提高细粒度的对象理解。其 LensUnd 管道采用 3D 本地化,为外部 2D 视觉语言模型选择信息丰富的互补视图,支持细粒度对象字幕、小物体定位和细粒度对象问答。 LensDistill 通过详细的字幕监控将生成的细粒度知识传输到 3D LLM,从而无需外部VLM调用即可从本机输入生成字幕。我们还构建了 LensBench,这是一个包含 2,068 个对象的留出评估集,每个对象具有三个银标准参考描述。 Video-3D LLM和 3DRS 的实验表明,LensDistill 显着改进了细粒度对象字幕,同时保留了现有的定位和场景级 QA 性能。这些结果确立了将外部获取的细粒度知识转移到本机 3D LLM中的可行性。

Lens3D:用于细粒度 3D 理解的目标条件视觉焦点的原论文方法或结果图
图 2:Lens3D 概述。 (a) LensUnd 遵循 Ground-Focus-Understand:3D grounder 根据语言查询 $q$ 定位锚框 $b$,bbox-voxel 通过覆盖增益选择互补视图并将目标线框投影到它们上,外部 2D VLM生成目标的详细理解 $y^{\star}$。 (b) LensDistill 训练具有序列级蒸馏损失 $-\log p_{\theta}(y^{\star}\mid X,c(b),p)$ 的 3D LLM学生模型,使用教师模型生成的 $y^{\star}$ 作为特权监督,而学生模型接收均匀采样的本机视图、编码为 <coord> 的目标中心 $c(b)$ 和任务提示。 (c) 蒸馏后,外部LensUnd路径被移除; 学生模型可以对原生 RGB-D、目标中心和任务提示产生相同的详细理解。