论文
CONDUIT:视觉语言模型中 KV 缓存重用的统一剩余流恢复框架
CONDUIT: A Unified Residual-Stream Restoration Framework for KV Cache Reuse in Vision-Language Models
摘要
视觉语言模型 (VLM) 通常会回答有关重复出现的视觉内容的新问题,其中重用键值 (KV) 缓存可以避免重新编码昂贵的视觉前缀。然而,当相同的视觉内容出现在更改的前缀下时,精确前缀重用就会失败。选择性重新计算可以在小视觉 词元预算 下恢复质量,但前提是刷新正确的过时词元。原始注意力选择可能会将预算浪费在具有较小值范数代理分数的高注意力标记和与查询无关的图像上。为了解决这些故障模式,我们提出了 CONDUIT,这是一种 无需训练 刷新策略,它将单图像和多图像重用统一为残余流恢复。 CONDUIT 基于范数加权注意力,使用缓存键查询注意力和可访问的预输出缓存值范数代理对缓存的视觉标记进行排名,然后在进行全局选择之前应用经验图像级相关性放大。对于一幅图像,系数为 1,并且规则简化为图像内标记选择。该方法保留了模型架构和权重,在推理时仅添加单个查询条件评分通道。在 10% 的刷新预算下,CONDUIT 在三个 VLM 主干上实现了对应的完全预填充五个数据集平均值的 97.0-99.5%,并且平均领先于预算方法;在 MMLongBench-Doc 延迟子集上,它使用了 13.5% 的全预填充 FLOP,并实现了 2.99 倍的首次词元时间加速。