论文

通过分层视图到词元传输的零样本 3D 问答

Zero-Shot 3D Question Answering via Hierarchical View-to-Token Transportation

上下文与知识上下文工程

摘要

最近,通过 2D 视觉语言模型 (VLM) 进行的零样本 3D 场景理解因其具有前景的空间推理能力而引起了越来越多的研究兴趣。通常,从 3D 点云中采样多个 2D 视图,并将其输入到预先训练的 VLM 中以回答给定问题。这种范例强调了输入上下文质量的关键作用,并提出了在有限的输入预算下保留尽可能多的与任务相关的 3D 细节的挑战。我们提出 \texttt{KeyVT},一种在视图和词元级别收集输入上下文的分层方法。具体来说,我们将像素特征与相机参数相结合,并根据语义内容和几何位置评估视图重要性,从而产生空间一致且与任务相关的视图。此外,我们通过在最佳传输(OT)框架下识别代表性词元来解决所选视图中补丁之间的冗余问题,其中视图词元和关键词元被制定为嵌入空间中的两个离散分布。这些关键词元预计将通过最小化 OT 距离来覆盖所有视图特征。我们在三个广泛使用的基准上评估我们的框架,证明了对现有免调优方法的显着改进以及与基于训练的方法相当的性能。