论文
压缩方法很重要:LLM 即时压缩中与基准相关的输出动态
Compression Method Matters: Benchmark-Dependent Output Dynamics in LLM Prompt Compression
摘要
即时压缩通常通过输入词元减少来评估,但其实际部署影响取决于压缩如何改变输出长度和总推理成本。我们对激进压缩下依赖于基准的输出动态进行了受控复制和扩展研究,涵盖了三个基准和多个提供商的 5,400 个 API 调用。为了解释相互矛盾的先前观察结果,我们形式化了指令生存概率(Psi),这是一种结构度量,用于捕获截断后任务关键提示段是否保留。结果显示出很强的基准效应:在 r=0.3 下,DeepSeek 在 MBPP 上表现出严重的输出扩展(56x,Psi 约 0.15),但在 HumanEval 上的扩展明显较低(5x,Psi 约 0.72),而 GPT-4o-mini 在各个基准测试中相对稳定。通过识别提示结构而不是单独的提供者身份作为主要调节者,这调和了先前报告的极端爆炸和较低复制效果之间的明显差异。我们引入了压缩鲁棒性指数(CRI)进行跨基准评估,并表明单基准评估可能会产生有关压缩安全性和效率的误导性结论。为了结合能源声明的背景,我们结合了来自租用的 RunPod GPU 的配套直接 NVML 测量,并表明词元节省可能夸大了焦耳节省。这些发现激发了基准多样化测试和结构感知压缩策略,以实现可靠、节能的 LLM 部署。