论文
软提示调优,实现公平高效的 LLM 基准评估
Soft-Prompt Tuning for Fair and Efficient LLM Benchmark Evaluation
摘要
基准分数通常会歪曲 大语言模型 (LLM) 的知识,因为它们依赖于模型遵循特定格式要求的能力等。这尤其会惩罚那些可能知道正确答案但缺乏按照指示构建答案的能力(通常在 后训练 中引入)的基础模型。为了克服这个问题,我们提出了软提示调整,一种高效、公平且与架构无关的模型评估。通过在短时间内优化 10 个软提示向量(7B 模型的大约 0.0006% 参数),我们使模型适应特定的基准格式,缩小格式遵循的差距,并确保基础知识准确地反映在基准分数中。这使得人们可以在基准上公平地比较不同的基础模型(使用各种 预训练 配方进行训练),而无需完整的 后训练。我们评估了 7 个模型和 7 个数据集的软提示调整。结果表明,(a) 软提示调整在 80 个步骤(约 640 个样本)内使格式遵循饱和,使其非常高效,(b) 软提示调整显着优于零次和少量提示,显示标准提示未命中的基础模型知识,(c) 即使经过训练的模型也可以从软提示中受益,以最大限度地提高格式合规性,以及 (d) 软提示基础模型性能预测训练后模型排名比零样本和少样本基线更可靠,为下游模型质量提供低成本代理。我们的贡献包括(1)解开格式遵循和知识准确性的指标,(2)LLM知识的更公平的基准测试协议,以及(3)在LLM开发早期确定最佳预训练策略的成本和内存有效的方法。