论文
每条多模态证据一token:资源受限问答的潜在记忆
One Token per Multimodal Evidence: Latent Memory for Resource-Constrained QA
摘要
外部记忆有效地将基于大语言模型(LLM)和视觉语言模型(VLM)的问答(QA)建立在相关的多模态证据中。然而,现有的内存范式以原始文本和图像形式表示每个内存项,因此基于检索的系统必须将检索到的文本或图像传递给生成LLM/VLM,导致高令牌消耗和存储压力,使得资源受限的应用程序无法承受。我们提出了潜在记忆,一种潜在空间记忆范式,用小型压缩器 LLM/VLM 生成的单个高维潜在标记替换每个原始文本或图像证据项。潜在记忆不是检索原始证据来生成,而是在统一的潜在表示空间中运行:将查询嵌入到该空间中以检索相关的潜在标记,并将检索到的潜在标记直接提示到预训练的 LLM 或 VLM 以生成答案。为了使每个潜在标记同时为重建、检索和生成提供信息,我们以统一的端到端方式训练具有重建、对比和蒸馏目标的压缩器。潜在内存在七个纯文本 QA 基准(例如 HotpotQA)和多模态 QA 基准上进行评估,与高级 RAG 基准相比,它实现了有竞争力的 QA 性能,同时消耗的生成器令牌减少了 3 到 10 倍。它还可以提供 WebQA 上最强的基于图像的 QA 性能。代码可在 https://github.com/zz1358m/Latent-Memory-Master 获取。
