论文

知而不言的鸿沟:探针能看见置信度错过的错误

The Knowing-Saying Gap: When Probes See Errors that Confidence Misses

模型评测模型行为与机制分析

摘要

线性探针能以近乎完美的准确率检测语言模型中被破坏的上下文,但这并不能转化为可靠的失败预测。由此产生了一种对部署监控有直接影响的分离现象。在多跳算术链上,检测破坏的探针最终对最终答案的正确性没有信息量;被迫采用结构化置信度格式的模型坍缩为两个取值且错误率不可区分;探针跨跳的持续性也无法区分正确与错误结果,这驳倒了我们预注册的“持续性胜过峰值”假设。这种“知而不言”模式在包括推理模型在内的多个模型家族中普遍存在。作为实时监控器,基于探针的干预强烈依赖模型与错误类型:branch-and-pick在各模型上均为净收益,且在Llama-3.1-8B上独特地不破坏正确轨迹(挽救4例、破坏0例),而重新提示(reprompt)与替换前值(replace-prior)在挽救错误轨迹的同时,会以大致相同的比率破坏正确轨迹。基于探针的监控是口头表达置信度的必要补充,但没有单一干预占优,可部署的答案是按模型、按错误类型的路由。