论文
稳定性蕴含冗余:面向高效长上下文预填充的 Delta Attention 选择性停驻
Stability Implies Redundancy: Delta Attention Selective Halting for Efficient Long-Context Prefilling
摘要
在长上下文场景下,预填充计算成本是大语言模型(LLM)与大多模态模型(LMM)的重要瓶颈。尽管词元剪枝可以缩短序列长度,但先前方法依赖启发式规则,破坏了与 FlashAttention 等硬件高效内核的兼容性。在本工作中,我们观察到词元会向“语义不动点”(semantic fixing points)演化,使得进一步处理成为冗余。为此,我们提出 Delta Attention Selective Halting(DASH),一种免训练策略,它监控自注意力机制的逐层更新动态,选择性地停驻已稳定的词元。大量评估证实,DASH 在语言与视觉基准上均有泛化能力,在保持模型精度与硬件效率的同时带来显著的预填充加速。代码将发布于 https://github.com/verach3n/DASH.git。
