论文
Spectral-LSH:经Krylov投影局部敏感哈希的亚二次提示压缩
Spectral-LSH: Sub-Quadratic Prompt Compression via Krylov-Projected Locality-Sensitive Hashing
摘要
长提示推理依旧昂贵:prefill注意力随序列长度二次增长。我们提出Spectral-LSH,一个在提示进入语言模型之前操作的免训练提示压缩方法。Spectral-LSH用Krylov子空间法加随机特征近似隐式注意力核算子的主导分量,避免显式O(N²)的注意力核物化;随后在所得注意力特征空间中应用SimHash把相似token分组,聚为带因果位置指派的宏token。我们在C4上评估Mistral-7B-Instruct-v0.3、Qwen2.5-7B-Instruct与Qwen2.5-14B-Instruct。实验揭示压缩率的相变:ρ=4倍以下,局部token冗余低到轻量分块通常给出最佳延迟—质量权衡;ρ=8倍以上,谱路径保住分块丢失的质量;ρ=16倍时,Qwen2.5-7B(自适应)把PPL比从353.409降到196.963,Qwen2.5-14B(自适应)从9.533降到3.427。在含JSON、代码与表格样输入的小型长上下文压力测试上,8倍压缩下局部LSH也全面优于分块。自适应后端以低压缩走分块、高压缩走谱聚类捕捉两个regime,尽管总延迟上分块仍是最快后端。