论文

通过解码器层跳过缓解大语言模型幻觉

Mitigating Hallucinations in Large Language Models Via Decoder Layer Skipping

模型推理解码与生成控制

摘要

大型语言模型(LLM)在多样的自然语言任务上取得了强劲表现,但其输出常受幻觉困扰——即与事实信息不一致的内容。在这项工作中,我们对解码过程进行了全面的逐层分析,揭示出幻觉往往源自更深的解码器层。为解决这一问题,我们提出DeLask(Decoder Layer Skipping),一个动态跳过易产生幻觉的层的新型解码框架。DeLask利用了一个理论洞见:$L$层Transformer的前向计算在条件上等价于$L$步梯度下降。我们通过计算相邻解码器步骤所导出梯度之间的余弦相似度来定义“漂移值(driftance value)”,当下降方向发生反转时即识别出问题层。DeLask并不完全丢弃这些层,而是将其隐藏状态与前面的层部分聚合,从而在抑制错误信号的同时保持一致性。跨多种LLM和基准的大量实验表明,DeLask持续缓解幻觉并提升整体可靠性,为提高大规模语言模型的鲁棒性提供了一个轻量且可泛化的解码框架。

通过解码器层跳过缓解大型语言模型幻觉:论文配图
(a) (b) 图 1:(a) DeLask 的总体结构:我们首先采用提前退出策略,将每个解码器层的隐藏状态投影到最终的线性层,从而生成每个层词汇表的概率分布。接下来,我们计算相邻层之间的分布差异。从每个成对差异中,我们得出一个漂移值,定义为连续分布差异之间的余弦相似度。强烈的负漂移值表明相应的层更容易产生幻觉。一旦识别出这些层,我们就会部分地跳过它们,以减轻它们对整体模型性能的不利影响。 (b) 部分层跳过对 TruthfulQA 数据集的影响:它演示了层跳过对模型性能的影响,清楚地表明跳过某些解码器层可以提高准确性。