论文
内部探针何时优于直接读答案:隐藏知识与输出校准失效
When Do Internal Probes Beat Reading the Answer? Miscalibrated Readouts and Behavior-Concealed Knowledge in Language Models
摘要
一个0.6B语言模型被要求核验1200个逻辑结论,一半有效,一半仅经一次语义编辑破坏,却总回答“是”。行为上无法区分对错,但隐藏状态的线性探针以0.96 AUC读出正确判定,可迁移至未见逻辑结构,也能区分由真实结论相同词语构造的干扰项(0.90)。判定主要丢失于单一标量:沿对齐的读出方向,输出logits仍保有判定信息(间隔AUC为0.89),但偏移+4.6个标准差的饱和阈值将其抹去。在五模型、三模型家族的90种语义标签配置中,行为准确率随阈值偏移变化(Spearman −0.93),而间隔排序变化较小。跨13倍规模范围,内部知识趋于饱和,自由生成行为却不单调;8B模型因答案通道而非阈值问题落后于4B模型,强制选择准确率则单调。未在评测结构上拟合的单参数校正,使0.6B行为准确率由50%升至81%;校准间隔解码使8B恢复到94%。少样本提示同样通过重新居中阈值保持排序。比较探针与输出间隔可区分知识隐藏、校准失效和未检出。在干扰项不含表面线索的迷宫任务中,核验正确报告第三种状态。标准生成设置中,仅凭答案表面特征和启发式标签,无需读取内部状态,也可复现既有探针结果。