论文

H2S:先定位证据再摘要的长上下文压缩

Highlight-Then-Summarize: Learning to Compress Evidence for Long-Context Understanding

上下文与知识模型训练强化学习上下文工程

摘要

长上下文理解需要大型语言模型 (LLM) 来对冗长的文档、对话和代码进行推理,但与任务相关的证据通常稀疏且分散在大量不相关和冗余的内容中。我们提出了“突出显示然后总结”(H2S),这是一种压缩然后推理的范式,它首先识别基于源头的、与问题相关的证据,然后将其集成到一个紧凑的、以问题为条件的摘要中,然后再生成最终答案。为了训练这种行为,我们构建了 H2S-Dataset,其中包含来自 11 个基准系列的 6,647 个示例,平均上下文长度为 43.9K 个 token,并引入了 H2S-RL,除了最终答案的正确性之外,它还为证据选择和摘要构建提供了过程级奖励。我们对 H2S-Bench 进行评估,这是一个七任务长上下文套件。在共享 128K 输入和 4K 输出预算下,H2S-14B 的平均得分为 32.60,比 Qwen3.8-27B 高出 10.17 分,在评估的开源模型中获得了最强的整体成绩。 H2S-14B 还获得了最高的证据摘要质量得分,并仅以 4K 输出预算保留了 16K 预算性能的 97.1%。这些结果表明,明确选择和整合证据可以改善长上下文推理,同时实现更紧凑的生成。

H2S先从长文档定位可追溯证据,再总结并生成答案。
图1(图注摘要):H2S先从长文档定位可追溯证据,再总结并生成答案。