论文
内存树引导关键帧查询,实现高效 3D 问答
Memory Tree Guided Key Frame Querying for Efficient 3D Question Answering
摘要
由于视觉语言模型 (VLM) 推理的计算和内存资源有限,在具体场景中准确有效地回答问题提出了重大挑战。现有方法采用视觉搜索关键帧检索方法来选择与关键问题相关的关键帧用于VLM输入。然而,视觉搜索方法效率低下,因为它们需要针对每个单独的用户查询在数千个视频帧中进行视觉搜索。在这项工作中,我们提出了一种记忆树引导的关键帧选择范例,用于在具体场景中进行高效的 3D 问答。我们的方法利用紧凑且可重复使用的 3D 场景表示,称为 MemTree3D,它支持利用相机 6-DoF 姿势进行实时在线构建。 MemTree3D 捕获多级 3D 场景信息,使 大语言模型 能够通过我们基于评分的帧选择高效查询和检索与问题相关的关键帧,而无需重新处理整个视频流。在 OpenEQA 上,我们的方法将 GPT-4o 的 LLM-Match 提高了 17.4%,LLaVA-OneVision-7B 提高了 5.8%,优于现有的视觉搜索方法。我们的代码可在 https://github.com/hsiangwei0903/MemTree3D 获取