论文

思考不确定性:通过推理校准提高长式生成事实性

Think Through Uncertainty: Improving Long-Form Generation Factuality via Reasoning Calibration

模型训练强化学习

摘要

大语言模型 (LLM) 在长形式生成中经常产生幻觉。现有方法主要通过事后修正或基于正确性奖励的强化学习(RL)来提高事实性,但它们并没有教会模型估计其生成的哪些部分是可靠的。因此,模型仍然可能在其响应中自信地陈述不正确的主张。推理领域的最新进展显着提高了 LLM 的性能,并且通过将校准纳入 RL 目标来估计置信度。然而,现有的方法仍然仅限于整个响应的单个标量置信度,这对于长形式的生成是不够的,因为各个声明的不确定性各不相同。为了缓解这个问题,我们提出了 CURE,这是一个框架,通过教授 LLM 推理声明级别的不确定性来提高长篇事实性。我们首先引入声明感知推理协议,它将输出构建为原子声明并与显式置信度估计配对。然后,我们开发了一个多阶段训练管道,使模型置信度与声明的正确性保持一致,然后对事实进行优化。由此产生的校准置信度进一步实现选择性预测,使模型能够在推理时避免不确定的声明。对四个长篇事实性基准的实验表明,与竞争性监督和强化学习基线相比,CURE 持续提高了事实准确性,同时保持了事实回忆。特别是,它在传记生成方面将声明级别的准确性提高了高达 39.9%。这些收益伴随着校准的改进,FactBench 上的 AUROC 增加了 16.0% 反映了这一点。