论文
使用语义级奖励校准 LLM
Calibrating LLMs with Semantic-level Reward
摘要
由于 大语言模型 (LLM) 被部署在医学问答和法律推理等结果环境中,因此估计其输出何时可能正确的能力对于安全可靠的使用至关重要,需要良好校准的不确定性。具有可验证奖励的标准强化学习 (RLVR) 使用与置信度无关的二元正确性奖励来训练模型,不会对置信但错误的预测提供惩罚,从而降低校准效果。最近的工作通过训练模型来解决这个问题,以产生口头的置信度分数和答案,并奖励符合正确性的人。然而,言语置信度是在 词元级 上校准的,因此在具有相同语义的文本变体之间表现出不一致。我们提出了 \textbf{带有语义奖励(CSR)的校准},这是一个直接在语义空间中校准语言模型的框架,无需语言化的置信接口。 CSR 将正确性奖励与新颖的语义校准奖励相结合,通过促进语义一致性来鼓励正确的部署中的利用,并通过阻止虚假一致性来鼓励错误的部署中的探索。在 HotpotQA(分布内)和 TriviaQA、MSMARCO 和 NQ-Open(分布外)上的三个模型系列上进行的实验表明,在几乎所有设置中,CSR 始终比言语置信度基线实现更低的 ECE 和更高的 AUROC,与言语置信度基线相比,ECE 降低高达 $40\%$,AUROC 提高高达 $31\%$,校准行为在所有四个评估中都具有稳健的通用性设置。