VL-MemKnG:具有时空知识图的混合内存,用于在长自我中心导航轨迹上进行问答
VL-MemKnG: Hybrid Memory with a Spatio-Temporal Knowledge Graph for Question Answering over Long Egocentric Navigation Trajectories
摘要
在以自我为中心的长视频中回答与导航相关的问题需要检索和组织分布在遥远时间时刻的证据,同时保持空间和上下文的一致性。尽管长上下文视觉语言模型可以实现很强的答案质量,但对于长轨迹来说,它们的计算成本很高,并且对于重复查询来说效率低下。最近基于图的方法(例如 VL-KnG)通过持久的时空知识图解决了这一挑战,但仅以图为中心的检索可能无法代表更广泛的时间连续性和上下文线索。我们提出了 VL-MemKnG,一种混合记忆框架,通过将时空知识图与持久段级上下文记忆相结合来扩展 VL-KnG。知识图捕获结构化关系信息和远程对象关联,而段级内存则为长期证据检索保留更广泛的时间上下文。混合检索和推理模块联合操作两种记忆表示,以产生基于证据的答案和按时间组织的支持证据。我们还推出了 WalkieKnowledgeT+,它是 WalkieKnowledge 的扩展,用于面向长视距导航的视频问答。该基准包括需要跨多个非同时发生的时刻进行证据聚合的时间分布式推理任务。在 WalkieKnowledgeT+ 上,VL-MemKnG 将 Top-1 检索准确率从 58% 提高到 67%,将 Recall@1 从 34.50% 提高到 40.55%,优于所有比较方法,包括 Gemini 2.5 Pro 和 Qwen 3.5+。在时间全局和时间分散的聚合问题上,收益尤其明显,证明了将结构化关系记忆与段级上下文记忆相结合的好处,同时保持高效的查询时间推理。