论文

简洁性约束反转语言模型中的性能层次结构

Brevity Constraints Reverse Performance Hierarchies in Language Models

模型评测模型能力评测

摘要

标准评估协议揭示了一个违反直觉的现象:在跨越五个数据集的 7.7% 基准问题中,尽管参数多了 10-100 倍,但较大的语言模型的表现比较小的语言模型低 28.4 个百分点。通过对 1,485 个问题的 31 个模型(0.5B-405B 参数)进行系统评估,我们将该机制确定为自发的尺度相关冗长,通过过度阐述引入错误。因果干预实验表明,这反映了可纠正的提示设计,而不是基本的能力限制。限制大型模型产生简短的响应可将准确性提高 26 个百分点,并将性能差距缩小多达三分之二。最关键的是,简洁性约束完全颠倒了数学推理和科学知识基准的性能等级,大型模型比小型模型实现了 7.7-15.9 个百分点的优势——直接反转了原始差距。这些逆转证明大型模型具有比通用提示面具更优越的潜在能力。我们通过三个独立的污染测试验证了结果,并证明逆标度在整个参数范围内连续运行,数据集特定的最佳标度范围从 0.5B 到 3.0B 参数。我们的结果表明,最大化大型模型性能需要规模感知的即时工程,而不是通用的评估协议,这对部署具有直接影响:即时适应同时提高了准确性并降低了计算成本。