论文
可解码但固定残差流线性引导无法纠正:来自医疗LLM失败模式的证据
Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes
摘要
LLM隐藏状态中线性可解码的失败信号,能否被用来纠正那些失败?我们经由过度思考(OT)研究这一「分类-纠正鸿沟」——医疗QA中一个稳定的行为模式(Jaccard≥0.81、标注者间一致性94%):模型在重采样下答对、却在扩展思维链下答错。OT可线性解码(平衡准确率71.6%,p<1e-16)。但五个家族的固定线性引导(29种配置、n=1,273)全部Δ≈0,跨架构(Qwen2.5-7B)与跨域(MMLU-STEM)同样为零。三条汇聚证据提示表征纠缠:OT方向与任务关键计算有85-88%重叠(特异比≤0.152);非定向共享方向引导损害准确率(-12.1pp);LEACE概念擦除也损害准确率(-3.6pp,p=0.01),而10次随机擦除产生Δ=+0.3pp。逐实例探针-引导相关为r=-0.002(p=0.97)。积极面:同一探针支持选择性弃答(留出AUROC=0.610,超全部五个不确定性基线,p=0.009):可解码的失败结构支持生成后可靠性估计,即便固定线性引导家族无法利用它做纠正。
