论文
从僵化到动态:长上下文LLM的熵引导自适应推理
From Rigid to Dynamic: Entropy-Guided Adaptive Inference for Long-Context LLMs
摘要
现有的用于长上下文 LLM 推理的稀疏注意力和 KV 缓存压缩方法通常在所有注意力头中应用固定的稀疏模式或统一的预算,忽略了头和上下文之间注意力行为的巨大变化。我们观察到注意力头之间有两种不同的熵模式:刚性头(其熵在输入段上保持接近零)和动态头(其熵波动显着)。至关重要的是,这些类型的分布取决于上下文,无法离线预先确定。因此,我们提出了 EntropyInfer,这是一个免训练的框架,它使用注意力熵在预填充期间以各个头和段的粒度自适应地分配计算。对于解码,我们引入了一种潜在的 KV 缓存压缩方案,该方案利用生成的输出令牌(而不是单独预填充令牌)来识别和保留最关键的缓存条目。对 Llama、Qwen 和 openPangu 模型系列的大量实验表明,EntropyInfer 始终优于包括 SnapKV、AdaKV 和 CritiPrefill 在内的基线,在超过 100k 词元时实现高达 2.39$\times$ 的端到端加速,与完全注意力相比,质量下降最小。代码发布于 https://github.com/SHA-4096/EntropyInfer。
