论文
校准与决策:重新审视未学习语言模型中的可靠性悖论
Calibration vs Decision Making: Revisiting the Reliability Paradox in Unlearned Language Models
摘要
机器去学习的目的是消除模型中特定训练数据的影响,同时保留剩余数据的可靠行为,从而使可靠的预测和不确定性估计对于评估至关重要。校准通常用作语言模型可靠性的代理,但低校准误差并不一定意味着可靠的决策规则,因为模型可能依赖于虚假相关性,同时保持良好的校准。我们使用 TOFU 基准上的多项选择问答评估协议来调查生成语言模型中的这一差距,通过校准指标(ECE、MCE、Brier)来测量概率可靠性,并通过基于归因的快捷方式检测和集成梯度和局部互信息来测量决策规则可靠性。我们发现,与预训练模型 (ECE > 0.5) 相比,微调模型实现了较低的校准误差 (ECE ~ 0.04),并且尽管遗忘分割的准确性降低,但遗忘后的模型仍保持类似的低校准,而归因分析显示对基于相关性的标记的依赖增加。这些结果表明,良好的校准可以在遗忘后与基于快捷方式的决策规则共存,将可靠性悖论扩展到机器遗忘设置。