论文
熵门:LLM 管道中近乎无损词元压缩的熵淬灭
Entropy Gate: Entropy Quenching for Near-Lossless Token Compression in LLM Pipelines
摘要
LLM 管道在低信息内容上浪费了大量 词元预算:重复的上下文、冗长的响应和冗余的样板文件。我们介绍 Entropy Gate,一种词元压缩框架,应用熵淬灭 $-$ 热力学过程,逐步冻结低能量词元,同时保持语义保真度。每个词元接收结合统计、结构和位置分量的多因素信息能量$E(t)$。自适应淬灭方案 $T(τ) = T_0 / (1 + ατ)$ 会删除玻尔兹曼生存概率 $p_i = \exp(-E_i / kT)$ 低于阈值的标记,当能量加权相似度低于 $θ$ 时,保真度门将停止压缩。我们证明通过降序 $E(t)$ 进行标记选择可以最大化预期的语义保留,淬灭会产生嵌套的生存集,并且可实现的压缩接近信息理论极限 $\text{CR} \to 1 - I(P; T)/H(P)$。第一阶段启发式方法在五个提示类别中实现了 40-60% 的压缩,同时保持 $S_E > 0.80$,能量平方放大 $E \to E^2$ 增加了 10-25 个百分点。上下文重复数据删除可节省重复块 50-70% 的成本。输出侧抑制的发现是简洁可以提高准确性,进一步减少响应开销。与外部内存相结合,代理工作负载可成倍减少 88-96%。该框架是无状态的、与模型无关的,并部署为与 OpenAI 兼容的 HTTP 代理。