论文

探针稳健性的稳健评估:可靠的 OOD 不确定性量化的经验教训

A Robust Evaluation of Probe Robustness: Lessons for Reliable OOD Uncertainty Quantification

模型评测鲁棒性、公平性与可信度评测

摘要

最近的工作表明,大语言模型 的隐藏状态包含对不确定性估计有用的信号,激发了人们对基于高效探针的方法日益增长的兴趣。然而,目前尚不清楚现有方法的稳健性如何,之前的工作在截然不同的评估环境下报告了相互矛盾的结论。我们通过引入 ProbeDrift 来解决这个问题,这是一个用于监督不确定性探测的系统评估框架,涵盖了跨模型、任务和分布变化的广泛 OOD 设置。使用 ProbeDrift,我们训练了 2,000 多个探针来理清关键设计选择的影响,结果显示当前方法在接近 OOD 设置之外的鲁棒性很差。我们发现鲁棒性是由设计决策驱动的,这些设计决策在分布中具有很大程度上不可见的影响,包括特征类型、聚合策略和训练信号的选择。我们认为稳健的不确定性估计需要稳健的评估。为了支持这一点,我们将 ProbeDrift 作为一个轻量级 Python 库发布,其中包含支持我们广泛评估的训练和测试拆分。我们还展示了我们的评估见解如何通过简单的混合退避(HBO)策略直接产生更强大的方法。