论文

像素可解码性不是压缩信号:因果评估视觉 KV 缓存驱逐的重要性代理

Pixel Decodability Is Not a Compression Signal: Causally Evaluating Importance Proxies for Visual KV-Cache Eviction

模型评测模型行为与机制分析

摘要

视觉语言模型在其视觉键值缓存中保留大量可像素解码的视觉内容。我们表明,在我们的设置中,这种保留是任务惰性的:在我们预先注册的测试中,一个单元保留的数量永远不会积极地跟踪回答问题的计算是否因果地依赖于它。我们使用学习的像素反转解码器来测量保留率,并使用单超级补丁 KV 消融(教师强制的黄金答案对数概率下降)来测量因果使用,并在预先注册、符号校准、保留设计下将图像中的两者关联起来。保留与注意力脱钩,在动力充足的情况下,与因果利用脱钩。利用率对于每个代理来说并不是惰性的:注意力微弱但显着地跟踪它,我们发现的唯一信号和设计的积极控制。我们将像素可解码保留描述为视觉 KV 缓存的信息轴,与功能轴正交。缓存保存多少任务惰性内容因模型对中的架构而异:无编码器模型保留的内容是基于编码器的模型的 2.7 倍。工程结果是受控的负面结果。在超级补丁粒度下,去混杂的像素可解码保留排序 KV 驱逐并不比随机驱逐更好;在词元粒度上,它在较大的预算下仅获得微弱的反重要性信号,在每个预算中都由注意力程度主导。在我们的设置中,像素可解码的可重构性在我们测试的任何粒度上都不是一个有竞争力的 KV 压缩信号。