论文

RIS-Kernel:通过稀疏注意力进行长上下文 LLM 推理的模型无关架构

RIS-Kernel: A Model-Agnostic Architecture for Long-Context LLM Inference via Sparse Attention

模型优化稀疏化

摘要

大语言模型 中的完全自注意力可扩展为 O(N^2),这将长上下文文档分析限制为 65,536 个标记,并且需要昂贵的 GPU 集群。减少交互采样 (RIS) 推理引擎将这一约束作为与模型无关的架构来解决。在不修改权重的情况下,RIS 使用适合商品内存限制的稀疏随机几何结构将自注意力复杂度降低到 O(N log N)。我们在 Qwen2-1.5B-Instruct 上跨两种机制验证 RIS。在 32,768 个 token 的受控评估中(其中原生密集注意力作为上限),1% 密度和 70 个集成种子的 RIS-Stochastic 达到了 75.00% 的准确率,优于原生密集基线 (71.88%),而 5% 密度和 10 个种子的 RIS-Stochastic 与之匹配 (71.88%)。这表明稀疏注意力充当正则化器:多个种子上的低密度(1%)过滤掉序列级噪声,而较高密度(5%)重新引入干扰噪声。在最紧张的预算下,RIS-Structural 在 1% 密度下仅使用 10 个种子即可达到 68.75% 的准确率,相对于零上下文底线 (59.38%) 恢复了 75% 的上下文间隙。在 65,536 个词元上,密集注意力会触发内存不足错误,RIS 的检索增益比零上下文下限 (51.56%) 高出 14.06 个百分点,这在 McNemar 的配对测试中被证实具有边际显着性 (p = 0.078 < 0.10)。所有评估都在商用、未加速的 CPU 服务器(16-128 GB RAM)上运行,证明长上下文 LLM 推理在没有 GPU 加速的标准学术硬件上是可行的。