论文

语言模型如何失败:词元级 承诺和持续推理失败的签名

How Language Models Fail: Token-Level Signatures of Committed and Persistent Reasoning Failures

模型评测模型行为与机制分析

摘要

语言模型推理中的失败是通过不同的过程出现的,这些过程在推理轨迹中留下了可识别的签名。我们使用 词元级 不确定性信号来描述这些故障,发现它们是通过两个经验上可区分的过程产生的。第一个是提交失败,其中模型在其跟踪的早期锁定到不正确的推理路径。中央诊断签名是承诺点,超出该承诺点考虑额外的词元会损害而不是帮助故障检测。在第二种情况下,持续的不确定性,不确定性反而会在整个过程中积累,并且需要完整的跟踪来最好地区分失败与成功的完成。这些签名在 23 个模型数据集配置中重现,框架的可证伪预测在 23 个案例中的 20 个中成立,远高于两种故障模式的概率。最后,我们证明我们的故障模式框架对自我一致性有直接影响,确定不确定性信号何时补充它以及何时可以有选择地跳过它。这些结果为理解 LLM 推理故障何时可检测以及相应地调整检测策略奠定了基础。