论文

迈向大语言模型中可靠的真实对齐不确定性估计

Towards Reliable Truth-Aligned Uncertainty Estimation in Large Language Models

模型推理推理验证与自校正

摘要

不确定性估计(UE)旨在检测大语言模型(LLM)的幻觉输出,以提升其可靠性。然而,UE指标在不同配置下常表现出不稳定的性能,这显著限制了其适用性。在这项工作中,我们将这一现象形式化为代理失效(proxy failure),因为大多数UE指标源于模型行为,而非明确建立在LLM输出的事实正确性之上。基于这一形式化,我们表明UE指标恰恰在低信息情形中变得不具区分性。为缓解这一问题,我们提出Truth AnChoring(TAC),一种事后校准方法,通过将原始分数映射为真实对齐的分数来修复UE指标。即使在带噪声与少样本的监督下,我们的TAC也能支持学习到校准良好的不确定性估计,并给出一种实用的校准协议。我们的发现凸显了将启发式UE指标直接视为真实不确定性指标的局限,并将我们的TAC定位为迈向更可靠的LLM不确定性估计的必要一步。代码仓库发布于 https://github.com/ponhvoan/TruthAnchor/。

迈向大语言模型中可靠的真实对齐不确定性估计:论文配图
图1:常用与近期不确定性方法及本文TAC分数的可靠性图对比,检验不确定性估计与真值的对齐可靠性。