论文

论LLM元认知监控的局限性

On the Limits of Metacognitive Monitoring in LLMs

模型评测模型行为与机制分析

摘要

可靠的决策取决于识别答案何时可能是错误的。在生物认知中,元认知监控可能与任务表现脱节,这就提出了语言模型中解决和判断的联系有多紧密的问题。在这里,我们研究了 15 个基准的 4 个前沿模型的置信度报告。高任务准确性可以与弱错误辨别共存:模型解决了 97% 的竞赛数学问题,而其回答时间置信度将正确答案排在错误之上,略高于机会。对于由单独的参考模型解决的问题,置信度可以更有效地将正确答案与错误区分开来,而审查对参考困难问题带来的改进有限。总体歧视还奖励将简单问题的正确答案排名高于困难问题的错误答案,仅问题预测已经做得很好。交叉评估在评估者回答正确的情况下最有帮助,并且两个模型共有的错误通常保持很高的置信度。即使在具有强大问题解决能力的模型中,难题和共同错误仍然是促进自我审查和同行监督的困难目标。