论文

SemanticFold:潜在上下文压缩对语言建模与推理的不同影响

SemanticFold: Latent Sequence Compression SeparatesLanguage Modeling, Decodability, and Reasoning

上下文与知识模型推理模型评测KV Cache上下文工程评测方法与指标

摘要

我们研究提示前缀的潜在序列压缩是否保留了大型语言模型在推理过程中所依赖的功能。我们引入了 SemanticFold,一种在学习边界处折叠前缀隐藏状态的压缩方案,并在五个模型尺度上对其进行评估:Qwen3-1.7B、Qwen3-8B、SmolLM2-1.7B、Pythia-1.4B 和 Pythia-6.9B。我们使用固定目标协议:冻结前缀本地执行或压缩,并且两个手臂都使用相同的延续Token。这种设计排除了对可能性变化的目标选择解释。我们研究了五个端点系列:固定目标负对数似然、有限标签推理准确性、线性探针可访问性、开放式生成以及系统级内存和延迟。我们发现压缩非单调地移动这些端点,并且它们不共享单个压缩阈值。在压缩比 R=1.7 的 Qwen3-1.7B 上,在 10000 次绘制的配对引导下,压缩减去原生平均 NLL 降低了 0.135。在 R=1.2 的 SmolLM2 上,平均变化比原生高 0.013。在 在两个 Pythia 检查点中,NLL 实际上都没有改变。将序列缩短与学习的残差变换分开的 NLL 分解表明,有利的 Qwen 似然主要归因于残差适应,而不是单独的缩短。仅 MLP(应用变换而不缩短)的 NLL 比 Full SemanticFold 低 0.082。在不同条件下,线性探针精度和宏 AUC 的绝对值变化小于 0.03,置信区间为零。我们得出的结论是,潜在压缩下的保存没有单一的标量证书:语言模型拟合、可解码性和推理行为回答不同的问题,并且可以在相同的压缩操作下向不同的方向移动。