论文

发现隐藏的误校准机制

Discovery of Hidden Miscalibration Regimes

模型评测鲁棒性、公平性与可信度评测

摘要

通常通过将模型置信度与其经验正确性进行比较来评估校准,隐含地将可靠性视为仅置信度得分的函数。然而,这种观点可能隐藏了实质性结构:模型可能系统性地对某些类型的输入过于自信,而对其他类型的输入不足,导致全局可靠性诊断掩盖了局部校准失败。为了解决这个问题,我们提出了在不假设访问预定义数据切片的情况下发现隐藏的误校准机制的问题。我们定义了相应的误校准场,并提出了一个用于估计它的诊断框架。我们的方法学习输入空间的校准感知表示,并通过学习几何中的核平滑来估计有符号局部校准错误。在四个现实世界的 LLM 基准测试和十二个 LLM 中,我们发现依赖于输入的校准异质性很普遍。我们进一步表明,所发现的字段是可行的:它们支持局部置信度校正,并减少系统性错误校准区域中的校准误差,在这些区域中,等渗回归和温度缩放等基于置信度的方法效果较差。