论文

ORCE:大语言模型 中言语置信度的订单感知对齐

ORCE: Order-Aware Alignment of Verbalized Confidence in Large Language Models

模型训练偏好优化

摘要

大语言模型 (LLM) 通常会产生高度确定的答案,即使它们不正确,这使得可靠的置信度估计对于实际场景中的部署至关重要。语言化置信度,即模型明确表达其对自然语言的置信度,提供了灵活且面向用户的不确定性信号,即使在词元 logits 不可用时也可以应用该信号。然而,现有的言语置信度方法通常会联合优化答案生成和置信度生成,这可能会导致置信度调整目标干扰答案的准确性。在这项工作中,我们提出了一个用于言语置信度校准的解耦和订单感知框架。我们的方法首先生成一个答案,然后估计以固定问题-答案对为条件的置信度,从而允许置信度优化而不直接扰乱答案生成过程。为了使置信度与正确性可能性保持一致,我们从多个模型完成中构建基于采样的代理,并优化基于排名的强化学习目标,鼓励具有更高估计正确性可能性的响应以获得更高的言语置信度。推理和知识密集型基准的实验表明,我们的方法提高了校准和故障预测性能,同时在很大程度上保持了答案的准确性。这些结果表明,通过将置信度估计与答案生成解耦并优化响应之间置信度的相对顺序,可以更可靠地调整言语置信度。