论文

具有元认知反馈的强化学习在 LLM 中引发了忠实的不确定性表达

Reinforcement Learning with Metacognitive Feedback Elicits Faithful Uncertainty Expression in LLMs

模型训练偏好优化

摘要

元认知是智力的一个重要组成部分,它描述了监控和调节自身认知过程的能力。然而,LLM 在关键元认知能力方面表现出系统性缺陷:他们高度自信地产生幻觉,无法识别知识边界,并歪曲其内部不确定性,从而破坏了可信度和可靠性。由于监控任务绩效并相应地调整行为是元认知的核心,因此我们认为能够准确判断自身绩效的模型更有能力改进它。我们通过两种新颖的机制来实现这一想法:带有元认知反馈的强化学习(RLMF),这是一种在偏好优化过程中根据模型自我判断的质量来完善完成排名的范式,以及元认知数据选择,它使用类似的自我判断来识别高价值的训练示例,优于朴素的主动学习。我们将这些创新应用于忠实校准(FC)问题,这项任务本身从根本上来说是元认知的:目标是用内在的不确定性来表达,即使对于前沿的 LLM 来说也是很困难的。我们采用两阶段、解耦的方法,首先使用这些方法来校准模型自我报告的置信度分数的 忠实性,然后通过有针对性的输出编辑映射到自然的、上下文适应的语言不确定性。大量实验表明 RLMF 在不同任务上实现了可推广的、最先进的 FC,同时保持了准确性。此外,RLMF 比标准 RL 提高了 63%,同时增强了模型评估和表达自身能力限制的能力。这将 RLMF 定位为增强 LLM 元认知以提高能力和一致性的有前途的范例,并建议将元认知性能作为有效的 RL 信号来克服先前内在反馈方法的限制。