论文
三思而后行:利用内部归因信号进行事实解码
Look Before You Leap: Factual Decoding with Internal Attribution Signals
摘要
幻觉仍然是大型语言模型(LLM)中的一个关键挑战,其中早期的事实错误通过自回归生成而复合,形成滚雪球效应,事后纠正和权重水平干预都无法有效预防。我们提出了 DescaPE(针对路径错误滚雪球的解码信号控制),这是一种解码框架,利用内部模型信号在推理时抑制容易产生幻觉的轨迹。通过滑动窗口 MLP 消融,我们识别了 LLM 内的事实显着层跨度,其派生信号针对事实标记有选择性地升高,并在容易产生幻觉的步骤中表现出异常尖峰。我们训练一个轻量级探针来近似来自单个前向传递的信号,并将其集成到候选评分中,以惩罚高风险的延续,同时奖励基于事实的延续。在三个大语言模型的五个事实性基准上进行的实验表明,DescaPE 在多种设置中实现了相对于解码时间基线的事实性改进,同时在我们的效率评估中仅产生 1.10 倍的延迟开销。我们的代码可在 https://github.com/hayinggg/DESCAPE 获取。