论文
Lens3D:用于细粒度 3D 理解的目标条件视觉焦点
Lens3D: Target-Conditioned Visual Foveation for Fine-Grained 3D Understanding
摘要
现有的 3D 大语言模型经常忽略细粒度的属性和视觉上不太显着的对象和部分,即使场景视频中存在相关证据也是如此。我们引入 Lens3D,通过外部视觉辅助和知识转移来提高细粒度的对象理解。其 LensUnd 管道采用 3D 本地化,为外部 2D 视觉语言模型选择信息丰富的互补视图,支持细粒度对象字幕、小物体定位和细粒度对象问答。 LensDistill 通过详细的字幕监控将生成的细粒度知识传输到 3D LLM,从而无需外部VLM调用即可从本机输入生成字幕。我们还构建了 LensBench,这是一个包含 2,068 个对象的留出评估集,每个对象具有三个银标准参考描述。 Video-3D LLM和 3DRS 的实验表明,LensDistill 显着改进了细粒度对象字幕,同时保留了现有的定位和场景级 QA 性能。这些结果确立了将外部获取的细粒度知识转移到本机 3D LLM中的可行性。
