论文
LLM没有表现出个性化元认知的迹象
LLMs Show No Signs Of Individuated Metacognition
摘要
置信度加权路由、选择性弃权和整体加权都假设模型的置信度能够提供有关其解决所提出问题的能力的信息。他们假设功能性元认知,即在不运用自身能力的情况下评估自己能力的能力。总体校准得到了很好的研究,结果好坏参半,但引发置信度的基本结构尚不清楚。我们使用四向因子分析与成对校准相结合,分解来自 20 个前沿 大语言模型 (LLM) 跨六个基准的二元置信度判断,询问置信度不同的两个模型在性能上是否也不同。在事实回忆和信息检索基准上,跨模型置信矩阵近似为一阶,并且单个主导因素捕获了大部分潜在方差。检索事实的模型共享一个项目级难度轴,主要不同之处在于沿该轴的决策阈值。在所有基准测试中,一旦所有模型都同意的项目被删除,置信度和性能之间的关系就会崩溃。即使在统计上显着的情况下,模型间的成对校准也很小,一旦控制了沿着共享因子的基本率差异,剩下的就会缩小到零。数学推理是明显的例外,但事实证明,这是一个令人困惑的问题,推理模型通过尝试在思维链中解决有关其信心的问题,绕过了我们寻求测量的子符号自我知识。我们没有发现任何测试领域中存在显着的语言化个体元认知的证据。