论文
“我可能没有表达清楚”:诊断 LLM 推理时的动态不稳定性
"I May Not Have Articulated Myself Clearly": Diagnosing Dynamic Instability in LLM Reasoning at Inference Time
摘要
大语言模型(LLM)的推理失败通常只在生成结束时度量,但许多失败表现为过程层面的崩溃:模型在推理中途“丢了线索”。我们研究此类崩溃能否从标准 API 可获得的推理时可观测变量(token 对数概率)中检测出来,且无需任何训练或微调。我们定义一个简单的不稳定性信号,结合相邻步的分布漂移(JSD)与不确定性(熵),用每条轨迹的不稳定性峰值强度来概括它,并证明该信号能可靠预测失败。在 GSM8K 与 HotpotQA 上,不稳定性强度以高于随机水平的 AUC 预测错误答案,并在不同模型规模上于大规模数据中产生单调的桶级准确率下降。关键的是,我们证明不稳定性并非一律有害:早期不稳定性可能反映随后的稳定化与最终正确答案(纠正性不稳定性),而晚期不稳定性之后更常出现失败(破坏性不稳定性),即便峰值幅度相近。这表明可恢复性不仅取决于分布变化的强度,还取决于此类变化相对于剩余解码行程出现的时间。该方法与模型无关、免训练、可复现,被定位为一种诊断视角,而非纠正或控制机制。
