论文
CaliDist:通过行为鲁棒性来校准 大语言模型 分散注意力
CaliDist: Calibrating Large Language Models via Behavioral Robustness to Distraction
摘要
大语言模型 (LLM) 的现有校准方法常常忽视可信度的一个关键维度:模型对不相关或误导性信息的行为鲁棒性。在本文中,我们认为模型的真实置信度应该反映其在认知压力下的稳定性。我们引入了 CaliDist,这是一种新颖的事后校准方法,可以直接测量和惩罚模型对干扰的敏感性。 CaliDist 量化当 LLM 的输入提示受到语义干扰因素干扰时,其预测和不确定性如何变化。然后使用该稳定性(或缺乏稳定性)信号来自适应地缩放模型的初始置信度得分。我们使用六个不同的 LLM 对七个自然语言理解分类基准进行了广泛的实验,结果表明,与强基线相比,CaliDist 始终实现较低的预期校准误差 (ECE) 和 Brier 分数。值得注意的是,我们的方法将 ECE 平均从 23% 降低到 7%,相对提高了 70%,这表明行为稳定性是校准的强大信号。我们在 github.com/anas-jawad/CaliDist 上提供代码和数据集。