论文

“我可能没有表达清楚”:诊断 LLM 推理时的动态不稳定性

"I May Not Have Articulated Myself Clearly": Diagnosing Dynamic Instability in LLM Reasoning at Inference Time

模型评测模型行为与机制分析

摘要

大语言模型(LLM)的推理失败通常只在生成结束时度量,但许多失败表现为过程层面的崩溃:模型在推理中途“丢了线索”。我们研究此类崩溃能否从标准 API 可获得的推理时可观测变量(token 对数概率)中检测出来,且无需任何训练或微调。我们定义一个简单的不稳定性信号,结合相邻步的分布漂移(JSD)与不确定性(熵),用每条轨迹的不稳定性峰值强度来概括它,并证明该信号能可靠预测失败。在 GSM8K 与 HotpotQA 上,不稳定性强度以高于随机水平的 AUC 预测错误答案,并在不同模型规模上于大规模数据中产生单调的桶级准确率下降。关键的是,我们证明不稳定性并非一律有害:早期不稳定性可能反映随后的稳定化与最终正确答案(纠正性不稳定性),而晚期不稳定性之后更常出现失败(破坏性不稳定性),即便峰值幅度相近。这表明可恢复性不仅取决于分布变化的强度,还取决于此类变化相对于剩余解码行程出现的时间。该方法与模型无关、免训练、可复现,被定位为一种诊断视角,而非纠正或控制机制。

“我可能没有表达清楚”:诊断 LLM 推理时的动态不稳定性
图1:推理时的动态不稳定性作为诊断信号。大语言模型推理中动态不稳定性推理时诊断方法的概念性概览。 在每个解码步 t,我们仅观测重归一化后的 top-k 下一词元分布 p̃_t,它作为黑盒推理时信号即可获取;无需隐藏状态、梯度或训练访问权限。 不稳定性事件表现为高概率候选之间概率质量的突然重排,并伴随连续步骤之间不确定性(更高熵)的增加。 我们定义诊断不稳定性信号 I_t = D_t + λH_t,结合分布偏移 D_t = JSD(p̃_t, p̃_{t-1}) 与不确定性 H_t。所有量均在推理时仅由 p̃_t 计算得到,总体不稳定性强度概括为 S = max_t I_t。 不稳定性强度 S 与更高的失败风险相关,而峰值位置(相对位置 ρ)提供互补信息,可区分较早(更可恢复/可纠正)与较晚(较难恢复/更具破坏性)的不稳定性事件。