论文

长上下文语言模型的可合并模型端聚合状态

Mergeable Model-Side Aggregation States for Long-Context Language Models

摘要

长上下文语言模型的一个已知限制是,随着上下文长度的增长,它们在非可加性、基于集合的聚合中的性能越来越不可靠。例子包括基数估计、集合关系和分组统计,它们广泛存在于日志、程序输出、表格和多轮对话中。为了提供这些任务所需的聚合状态,我们引入了一个模型端聚合接口,该接口可与冻结的语言模型一起维护紧凑的基于哈希的 HyperLogLog (HLL) 草图状态。当模型处理上下文时,提取器将每个相关记录映射到规范身份。然后对身份进行哈希处理并更新 HLL 状态。这些状态可以跨上下文段合并和/或直接读出以进行下游推理,从而避免额外的生成-执行-返回周期。我们通过将 HLL 状态大小设置为 2 KiB(2,048 个寄存器)来验证所提出的方法,该大小不会随着上下文长度或设置基数而增加。在涉及 100 万条记录的不同计数实验中,平均相对误差为 1.6%。在单独的合并测试中,由多达 256 个段构建的状态产生了与同一流上的单次传递完全相同的读数。在来自 174 个源窗口的 3,969 个聚合然后推理任务中,固定预算接口在 Gemma 4(31B,BF16)上达到了 99.2% 的准确率,而在精确聚合下为 100.0%;配对差距为 0.8 个百分点(95% 窗口集群 CI:0.5-1.3 个百分点)。在 174 个项目的匹配集上,我们的方法比直接全上下文推理在 Qwen 上提高了 63.2 分,在 Gemma 上提高了 56.3 分。相对于思想链 (CoT) 推理的相应收益分别为 60.9 点和 63.2 点。在固定的 1,200 任务 Oolong-Synth 子集上,我们的方法在 Qwen 上达到了 91.1%,在 Gemma 上达到了 99.3%。代码可在 https://github.com/songdc98/sketchops 获取。