论文

LatentPress:超越文本和视觉的上下文压缩

LatentPress: Context Compression Beyond Text and Vision

上下文与知识上下文工程

摘要

压缩上下文通常作为人类可读的文本或必须解码的渲染图像来承载,即使它的使用者是语言模型。我们引入 LatentPress,它将对话历史和长文档写入第三种表示形式:冻结解码器直接通过其输入嵌入接口读取的连续内存标记,推理时无需文本重建。小型读取器匹配写入器压缩 $4$-$16\times$,同时仅训练适配器(4.2M-26.2M 参数,解码器的 $\sim\!0.1\%$)。在 LongMemEval 上,LatentPress 在 7.70\times$ 压缩下达到 0.504$ 准确率,而未压缩证据的准确率为 0.490$,优于文本摘要 (0.184) 和基于 OCR 的压缩(0.426 至 0.312)。在 LongBench-QA 上,域内编写器在 $4$-$8\times$ 压缩下匹配或超过原始上下文阅读,而 $16\times$ 落后于原始文本。每次对话写入需要 43 毫秒,大约比文本摘要或 OCR 重建快一个数量级,读取比原始上下文或缓存 OCR 快 $5$-$9\times$。我们在两种传输设置下验证接口,从 UltraChat 到 LongMemEval 内存 QA 的零样本,以及从 LongMemEval 派生的 QA 到未见过的 LongBench 文档域,建立直接软词元作为超越文本和视觉的实用的面向机器的上下文接口。实验的实现可以在:https://github.com/HJSang/LatentPress 找到。