论文

温度脆性和截断采样的条件优势

Temperature Fragility and the Conditional Benefits of Truncation Sampling

模型评测鲁棒性、公平性与可信度评测

摘要

大型语言模型通过从预测分布中采样每个标记来生成文本,并且温度参数设置绘制与最可能的标记的偏离程度。截断采样器(例如 top-p 和 min-p)会在抽签之前丢弃最不可能的标记,以便高温下的采样保持一致。他们报告的精度增益来自 1.5 到 3 的温度,而已部署系统的默认值介于 0.6 到 1.0 之间。它们是否会改变这些默认值下的准确性以及针对哪些模型,尚未进行测量。我们在 GSM8K 和 MMLU-Pro 上在一个受控管道中在温度 0.7、1.0 和 1.3 下测试了 13 个开放重量模型,其中 10 个模型在 8 种解码配置下进行测试。 13 个模型中的 6 个在 MMLU-Pro 上损失了 17 到 38 个精度点,介于 0.7 到 1.3 之间,另外 7 个模型最多损失 10 个。损失的精度来自于运行到词元限制或从不给出答案的代。这些结果表明,截断采样器主要在较高温度显着降低模型性能时提高精度。在不同温度下精度保持稳定的情况下,所测试的截断采样器都没有比普通温度采样有所改进。