论文

可解码但固定残差流线性引导无法纠正:来自医疗LLM失败模式的证据

Decodable but Not Corrected by Fixed Residual-Stream Linear Steering: Evidence from Medical LLM Failure Regimes

模型评测模型行为与机制分析

摘要

LLM隐藏状态中线性可解码的失败信号,能否被用来纠正那些失败?我们经由过度思考(OT)研究这一「分类-纠正鸿沟」——医疗QA中一个稳定的行为模式(Jaccard≥0.81、标注者间一致性94%):模型在重采样下答对、却在扩展思维链下答错。OT可线性解码(平衡准确率71.6%,p<1e-16)。但五个家族的固定线性引导(29种配置、n=1,273)全部Δ≈0,跨架构(Qwen2.5-7B)与跨域(MMLU-STEM)同样为零。三条汇聚证据提示表征纠缠:OT方向与任务关键计算有85-88%重叠(特异比≤0.152);非定向共享方向引导损害准确率(-12.1pp);LEACE概念擦除也损害准确率(-3.6pp,p=0.01),而10次随机擦除产生Δ=+0.3pp。逐实例探针-引导相关为r=-0.002(p=0.97)。积极面:同一探针支持选择性弃答(留出AUROC=0.610,超全部五个不确定性基线,p=0.009):可解码的失败结构支持生成后可靠性估计,即便固定线性引导家族无法利用它做纠正。

可解码但固定残差流线性引导无法纠正:来自医疗LLM失败模式的证据:论文配图
图 2:跨层对比向量之间的成对余弦相似度。早期层显示出低相似性(特定于模式的信息),而后期层则收敛到高相似性(>>0.9),反映了共享组件的主导地位。