论文

CacheReforge:适配器更新后有界修复陈旧 KV Cache

CacheReforge: Bounded Recovery for Stale KV Caches under Evolving Adapters

模型推理KV Cache

摘要

大语言模型用KV缓存减少长上下文和交互应用中的重复预填充。轻量适配器不断更新时,缓存仍反映旧版本,直接复用会扭曲当前模型输出;对受影响后缀全部重算虽恢复一致性,却成本很高。本文寻求恢复当前适配器行为所需的最少重算。现有系统追踪token、上下文或稳定适配器身份,但不表示旧版本缓存,也不区分更新传播深度与恢复行为实际需要的重算范围。CacheReforge把陈旧KV缓存表示为逐层混合版本对象,结合逐层适配器锚点、校准敏感度、累计漂移和可执行重启边界,在直接复用、有界重算和完整后缀恢复之间选择。研究区分依赖深度和功能重算范围,以累计尾部影响刻画何时有界恢复可保留当前行为。在持续LoRA更新的Qwen2.5-1.5B与7B上,包括16K HotpotQA和2WikiMQA负载,方法相对直接复用旧缓存减少平均KL散度92.4%,仅重算5.44%的层,相对全新完整预填充减少缓存维护时间93.2%。结果显示版本感知恢复可兼顾模型一致性和大部分缓存收益。

CacheReforge根据逐层风险评估,在缓存复用、有界恢复和完整重算之间选择。
图2(图注摘要):CacheReforge根据逐层风险评估,在缓存复用、有界恢复和完整重算之间选择。