论文
超越事后温度缩放:LLM 校准的双层优化
Beyond Post-Hoc Temperature Scaling: Bilevel Optimization for LLM Calibration
摘要
偏好对齐常常使 大语言模型 (LLM) 过于自信且校准不佳。传统的事后温度缩放本质上是与域相关的:在一个域上拟合的温度不能推广到跨域。这促使我们在训练期间修改模型参数以改进校准。我们建议将预测分布的熵最大化作为校准目标,它通过阻止过度集中的预测来直接针对过度自信。受温度缩放的启发,我们通过双层优化公式实现了这一点,其中较低层在参数损失下训练模型,而较高层选择损失超参数以最大化熵。为了使该框架在 LLM 规模上实用,我们采用了有效的一阶近似,避免了显式的二阶计算。在多项选择和开放式生成问答中,实验表明我们的方法产生了经过良好校准的 LLM,在域外泛化方面具有特殊优势。