论文

思考即压缩:你的推理模型其实是一个上下文压缩器

Thinking as Compression: Your Reasoning Model is Secretly a Context Compressor

上下文与知识上下文工程

摘要

上下文压缩旨在以最小的信息损失缩短长上下文输入,从而加速LLM推理。尽管现有方法已展现出前景,但它们通常依赖复杂的压缩模块或针对压缩的专门训练,使LLM的内在能力未得到充分挖掘。与此相反,本工作揭示思考模型本身就能通过组织任务相关信息来自然地压缩长上下文。据此我们提出思考即压缩(Thinking as Compression,TaC),一种将思考本身视为压缩后上下文的新压缩范式。无需依赖任何专门的压缩器,TaC直接提示思考模型生成思考轨迹作为缩短后的上下文,这已能超过多数代表性压缩方法。进一步地,鉴于原始思考输出可能难以控制预算并出现走捷径行为,我们提出约束版思考即压缩(TaC-C),利用简单的奖励驱动优化框架引导内在思考成为紧凑且可控的压缩上下文。在四个长上下文QA基准上的实验表明,TaC-C始终优于现有基线。在4倍与8倍压缩比下,其平均F1分别超过最强竞争者17.4%与23.4%,平均精确匹配得分(Exact Match Score,EM)分别超过15.7%与21.7%。

思考即压缩:你的推理模型其实是一个上下文压缩器:论文配图
图 1:上下文压缩范例的比较。 (a) 与任务无关的压缩全局地将长上下文压缩为与查询无关的内存表示。 (b) 任务感知压缩在解码之前使用查询来选择相关的上下文片段。 (c) 压缩思考利用模型的思维能力将与任务相关的上下文组织成紧凑的轨迹。