论文

压缩中的损失:提取提示压缩机的受控跨语言审核

Lost in Compression: A Controlled Cross-Lingual Audit of Extractive Prompt Compressors

模型评测鲁棒性、公平性与可信度评测

摘要

提取式即时压缩有望通过删除低信息标记来降低 LLM 推理成本,并且 LLMLingua-2 等学习压缩器在英语基准测试中报告了强劲的结果。大多数其他语言已经支付了词元溢价:相同内容的词元价格比英语高 1.3-1.8 倍。我们询问压缩是否会缩小或扩大这一差距。使用跨越五种脚本的十种语言的完全并行数据,并在目标模型的分词器中进行预算匹配的控制,我们根据四个确定性基线对来自十个供应商的十一个目标模型(超过 250,000 次评估调用)审核四个学习压缩器。其中三台压缩机接受过英语监督培训(LLMLingua-2 XLM-R/mBERT;来自生产 Headroom 堆栈的 Kompress-v2);第四个是 XProence,接受多语言培训。首先,传输差距是真实存在的,在目标模型和压缩器主干上复制,并且强烈依赖于速率:在 0.33 的保持速率下,英语保留了 57-62% 的标准化上下文利用率,而立陶宛语保留了 10-24%,中文基本上没有,尽管中文的词元溢价最小。其次,间隙跟踪压缩监督数据,而不是体系结构。所有三个经过英语训练的压缩器都显示了这一点,确定性方法没有显示出可比较的差距,而经过多语言训练的 XProvence v1 则没有显示出任何差距。它的 v2 版本在翻译数据上进行了重新训练,在没有任何警告的情况下以其激进的阈值清空了 92% 的中文上下文。第三,在更难的长上下文环境中,积极的学习压缩将五种非英语语言中的三种语言的压缩上下文驱动到或低于无上下文效用。在五种测试语言中,翻译后压缩管道以大约一半的词元成本与本机压缩相匹配或优于本机压缩。我们发布所有代码、压缩和模型输出。除英语之外,安全压缩预算要小得多。