论文

LLM 应明确表达不确定性

LLMs Should Express Uncertainty Explicitly

模型训练监督微调与指令调优

摘要

大语言模型 (LLM) 通常会产生自信但不正确的答案,这可能会导致实际应用程序中出现危险的故障。我们研究后训练是否可以使模型的自我评估变得明确:当模型不确定时,是否可以训练它在自己的响应中发出这样的信号?一个核心的设计问题是这个信号应该在响应中的何处暴露——在推理过程中,当答案仍在形成时,或者在最后,一旦答案已经产生。我们两者都研究。对于推理结束自我评估,我们训练模型以语言表达其响应的置信度分数,目的是对正确答案具有高置信度,对错误答案具有低置信度。对于推理过程中的自我评估,我们训练模型在当前推理状态出现不可靠时发出标记<不确定>。在事实推理任务中,这两种形式都大大减少了过度自信的错误,同时提高了答案质量,并且都可以用作检索增强生成(RAG)的触发器以改善最终响应。我们进一步分析了它们的内部机制:推理结束时的言语置信度强化了预训练模型中已经存在的置信相关结构,而推理过程中的<不确定>发射则教导模型标记高风险推理步骤,参数变化集中在模型的后期层。