论文
LongAttnComp:用于长上下文推理的跨家庭上下文压缩
LongAttnComp: Cross-Family Context Compression for Long-Context Reasoning
摘要
随着现实世界的应用程序越来越需要处理 100k+ 词元的输入,上下文长度和推理效率之间的差距已成为关键瓶颈。上下文压缩提供了一种在保持任务准确性的同时降低预填充成本的方法。然而,现有的基于注意力的 无需训练 方法在代码推理等要求较高的长上下文任务中存在巨大差距。我们提出了 LongAttnComp,这是 AttnComp 的长上下文改编,它微调了轻量级交叉注意力评分层,并引入了 tokenlevel 分块、token-budget top-p 算法、位置重新排序和格式无关的查询解析器。我们进一步为压缩器设计了一个两阶段的 微调 方案:第 1 阶段从 NIAH 风格的数据构建通用检索基础,第 2 阶段通过多跳和推理数据对其进行扩展,以实现更广泛的长上下文任务覆盖。在 InfiniteBench 代码调试上,LongAttnComp 匹配或超过全上下文准确性,大大优于 无需训练 基线,并可跨三个系列的四个目标模型进行传输。在 LongBench v2 上,两阶段配方在很大程度上缩小了多文档推理方面的第一阶段差距,同时保留了代码调试性能。