论文

LLM在接受训练以预测自己的准确性时会学习不同形式的元认知

LLMs learn different forms of metacognition when trained to predict their own accuracy

模型评测模型行为与机制分析

摘要

大语言模型经过训练,总是给出答案,无论它们是否拥有相关知识,这导致它们捏造事实。先前的工作表明,LLM的置信度估计与他们的实际表现不太相符,而微调可以大大改善他们的表现。然而,人们对模型在此类训练中实际学习的内容仍知之甚少。我们通过训练10个开放权重LLM,在回答事实性多项选择问题之前预测他们自己的准确性,从而研究LLM如何获得元认知监控,即知道自己知道什么的能力。我们发现训练有素的信心反映了两个不同的信号。在接近训练数据的问题上,它会跟踪模型的真实准确性,而在其他领域,它会跟踪输出一致性:模型答案分布的集中度。输出一致性跟踪出现在训练的早期,并在整个数据集中进行推广,而准确性跟踪则出现在较晚的阶段,并且保留在训练分布的本地。这些结果表明,校准训练可能无法教会模型普遍识别其自信作出的错误,并且它们提出了有关人工系统中元认知本质的更广泛问题。