论文
CAVEWOMAN:大语言模型 在语言输入和输出压缩下的行为方式
CAVEWOMAN: How Large Language Models Behave Under Linguistic Input and Output Compression
摘要
“说得简短一点。放弃语法。保存词元。”这种穴居人风格被广泛推广为一种降低推理成本的方法,但它是否真正节省任何东西取决于哪个渠道(用户的提示或模型的响应)被压缩。我们提出了 Cavewoman,这是一种双通道评估协议,可以对每一代人的任务准确性、实现的每项成本以及与模型的无约束参考的参考文本一致性进行评分。我们在五个数据集上以五个缩减级别评估八个模型,两个通道都在相同的项目上进行测量。输出压缩降低了大多数 API 模型的实现成本(每个模型 1.4-2.4 倍,最好情况下高达 3 倍)以及公共定价下的所有四个开放权重模型。输入压缩具有相反的效果,即严格的双输:它提高了净成本而不是降低了净成本(五个基准平均值约为 1.15 倍,最差数据集高达 1.8 倍,在更强压缩下高达 2.7 倍),因为即使精度下降,模型也会用更长的响应进行补偿。在相同的设置下,表面文本与无约束参考不同:在非推理模型上,所有生成中大约有一半是正确的,但它们的表面文本不再需要模型自己的无约束基线生成。这种分歧在长度控制的重新评分、多重比较校正以及互补语义测量下的复制中仍然存在。代码和数据可在 https://github.com/danielle34/cavewoman 获取。