论文
概率校准是语言模型中的可训练能力
Probabilistic Calibration Is a Trainable Capability in Language Models
摘要
语言模型越来越多地用于输出必须满足用户指定的随机性约束的环境中,但它们的生成概率通常很难根据这些目标进行校准。我们研究是否可以直接通过微调来提高这种能力。具体来说,我们在需要从数学分布中采样的合成提示上微调语言模型,并比较两种校准 微调 变体:一种将所需输出分布转换为 trie 派生的下一个标记目标的软目标方法,以及一种对来自相同目标分布的采样完成进行训练的硬目标方法。在跨越四个系列的 12 个模型中,两种方法都显着提高了保留分布系列和未见参数设置的结构化采样保真度,这表明概率校准是一种可训练的能力。在我们选择的训练配置下,这两种方法表现出不同的经验概况:硬目标 微调 通常在结构化数值采样方面最强,而软目标 微调 在更广泛的随机生成基准上表现更好,包括开放式随机生成、多项选择答案位置平衡和 NoveltyBench。收益有时会降低下游能力,尤其是算术推理,成本因模型而异。总体而言,我们的结果表明,可以通过 微调 改进概率校准,我们的硬目标配置有利于精确的数字保真度,而我们的软目标配置有利于更广泛的随机传递。代码可在 https://github.com/chandar-lab/calibration-finetuning 获取。