论文
模型知识更新后,置信度估计能否保持校准
Evaluating Persistent Calibration under Evolving Model Knowledge
摘要
随着人工智能系统从静态存储库转变为能够持续适应和学习的Agent,保持其可信度意味着支持它们的模型能够生成置信估计,动态反映其不断变化的技能和知识。我们引入了持续校准的问题,这需要置信估计器随着知识的变化忠实地反映模型中包含的知识,而无需反复监督。我们通过检查开放模型检查点的持久校准来实现这一点,询问在早期检查点上训练的置信估计器是否可以推广到后来的检查点。具体来说,我们的目标是阐明置信度是否依赖于知识,这个问题对置信度估计的可靠性具有影响。为了衡量这种关系,我们定义并评估知识对比集的校准:包含一个检查点正确回答而另一个检查点错误回答的问题的子集,反映了知识的变化。我们表明,与在未来检查点上训练的预言方法相比,推理时间和微调方法在对比集校准方面都存在不足,即使对于在完整数据集上经过良好校准的方法也是如此。我们为持久校准具有挑战性的假设提供了证据,因为在给定的检查点上存在大量可能的置信函数经过良好校准,其中只有一些依赖于可以推广到其他检查点的元知识特征。为了改进对比集校准,我们表明多检查点训练有帮助,这提出了一种识别在不断变化的知识中保持稳健的置信特征的途径。