论文
SAGE:言语不确定性对齐的答案条件不确定性目标
SAGE: Answer-Conditioned Uncertainty Targets for Verbal Uncertainty Alignment
摘要
大语言模型 越来越多地通过自然语言语句表达不确定性,但这些表达通常无法反映模型的采样行为。我们将言语不确定性对齐作为分布校准问题来研究:提示的适当不确定性目标应该根据重复的模型输出而不是孤立的响应来估计。然而,单独进行小组推广是不够的,因为最终的目标必须提供有用的训练信号。现有目标仅部分满足此要求。我们提出了 SAGE(语义答案引导熵),这是一个组级不确定性目标,可在采样响应上构建答案条件不确定性几何。 SAGE 保留了分类、数字和符号答案的区别,同时保持平滑且保留尺度的校准信号。我们通过群体不确定性偏好优化(GUPO)进一步应用这个目标,这是一种不确定性通道训练框架,可以监督言语不确定性表达而不是完整的反应。事实、数学和多项选择推理任务的实验表明,不确定性排名得到了改善,校准误差更低,过度自信也减少了。