论文

WaveFilter:通过小波引导的 KV 缓存过滤增强扩散 LLM 的长上下文能力

WaveFilter: Enhancing the Long-Context Capability of Diffusion LLMs via Wavelet-Guided KV Cache Filtering

模型推理KV Cache

摘要

Diffusion 大语言模型 (DLM) 在各种任务中都表现出了显着的优势。然而,受其多步迭代推理机制的限制,其在长上下文任务中的计算开销和推理延迟已成为限制其大规模部署的核心瓶颈。在处理长序列时,现有的键值(KV)缓存机制经常面临生成质量急剧下降的困境,其中核心挑战在于精确有效地过滤超长上下文中的关键词元。受人类阅读过程的启发,我们提出了 \textbf{WaveFilter},一个通用的 无需训练 缓存框架。该框架创新性地引入小波变换对长序列进行分解,实现关键标记的精确识别,并在此基础上构建稀疏KV Cache来计算最终的上下文表示。实验结果表明,WaveFilter作为即插即用的通用框架,显着增强了现有主流KV Cache方法在复杂长上下文任务中的性能。