论文
LLM 如何检测并纠正自己的错误:内部信心信号的作用
How LLMs Detect and Correct Their Own Errors: The Role of Internal Confidence Signals
摘要
大语言模型可以检测自己的错误,有时可以在没有外部反馈的情况下纠正它们,但底层机制仍然未知。我们通过决策神经科学的二阶信心模型来研究这一点。在一阶系统中,置信度源自生成信号本身,因此对于所选响应而言置信度最大,从而排除错误检测。二阶模型提出了一个部分独立的评估信号,该信号可能与承诺的响应不一致,从而为错误检测提供了基础。库马兰等人。 (2026) 表明 LLM 在紧随答案之后的标记处缓存置信度表示(即答案后换行符:PANL)——这会因果地驱动言语置信度并与对数概率分离。在这里,我们测试该 PANL 信号是否超出置信范围以支持错误检测和自我纠正。在这里,我们测试该信号是否支持错误检测和自我纠正,并从二阶框架得出预测。使用先验证后更正的范式,我们表明:(i)口头置信度预测的错误检测远远超出了词元对数概率,排除了一阶帐户; (ii) PANL 激活预测超出口头信心本身的错误检测; (iii) PANL 预测模型可以纠正哪些错误——所有行为信号都失效的情况。因果干预证实,当答案信息损坏时,PANL 会发出救援错误检测行为的信号。所有发现均在模型(Gemma 3 27B 和 Qwen 2.5 7B)和任务(TriviaQA 和 MNLI)中得到复制。这些结果表明,LLM 自然地实现了二阶置信度架构,其内部评估信号不仅编码答案是否可能错误,还编码模型是否具有修复它的知识。