论文

通过免训练的不确定性引导来减轻推理任务中的幻觉

Alleviating Hallucination in Reasoning Tasks with Training-Free Uncertainty-Guided Steering

模型推理解码与生成控制

摘要

最近关于大语言模型中的幻觉检测的工作表明,对于固定的预训练模型和推理任务,可以估计模型对其输出正确性的置信度。这种不确定性估计主要用于通过检测或过滤虚构来提高真实性。在这项工作中,我们询问是否可以更主动地使用这些信号来直接提高模型生成答案的准确性。我们提出了 USteer,一种简单的、免训练的转向机制,它在推理过程中使用相对于激活的置信度度量的梯度来调整模型的分层激活。该过程在推理时推动生成具有较低不确定性的输出,而无需修改模型参数或需要额外的监督。我们证明,这种方法能够持续减少一系列任务中的幻觉,证明置信信号不仅可以用于检测,还可以用于模型行为的有效推理时间控制。