论文

ReToken:用一个词元改善视觉语言模型的视觉检索

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

模型推理KV Cache

摘要

长视觉上下文对视觉语言模型提出了挑战:随着干扰因素数量的增加,性能会下降,并且在 GPU 内存限制下一次性处理所有标记在计算上是不可行的。我们提出了 ReToken,这是一个被训练为显式检索目标的单一可学习嵌入,它从预填充的视觉 KV 缓存中选择一组稀疏的与查询相关的视觉标记。仅在小型图像 QA 数据集上进行训练,ReToken 在图像和视频基准测试中产生了一致的增益:在 Visual Haystacks 上,它将 Qwen3VL-8B 提高了 13.4 点,将 InternVL3.5 提高了 12.4 点(相对 >20%),而在 LVBench 上,它将零镜头转换为长视频,与 Qwen3VL-8B 相比,获得了 8.0 点的增益。由于其轻量级设计,训练和长视频推理都适合在单个 H100 上进行。代码位于:https://github.com/avaxiao/ReToken