论文
TopoCompress:通过图连线语义轨迹进行长上下文压缩
TopoCompress: Long Context Compression via Graph-Wired Semantic Trajectories
摘要
长上下文压缩对于降低 大语言模型 推理的成本和延迟至关重要。然而,现有方法可能会分割重要证据,需要额外的训练或调整,并且通常依赖于目标模型来进行有效压缩。我们引入了 TopoCompress,这是一个 无需训练 和模型无关的框架,它通过选择连贯的语义跨度来压缩长上下文。 TopoCompress 首先使用密集和词汇查询相关性以及语义加速对每个跨度进行评分。然后,它构建一个混合图,该混合图根据语义相似性和顺序邻接性连接跨度,并在该图上传播查询引导的相关性分数。在五个长上下文任务中——HotpotQA、2WikiMQA、MuSiQue、Qasper 和 MultiFieldQA-en-TopoCompress 始终优于强大的压缩基线。值得注意的是,TopoCompress 在使用较小 4 倍的压缩预算的情况下实现了与最强基线相当的性能,并提供了比最快基线少 1.41 倍的压缩时间。