论文
通过解码器层跳过缓解大语言模型幻觉
Mitigating Hallucinations in Large Language Models Via Decoder Layer Skipping
摘要
大型语言模型(LLM)在多样的自然语言任务上取得了强劲表现,但其输出常受幻觉困扰——即与事实信息不一致的内容。在这项工作中,我们对解码过程进行了全面的逐层分析,揭示出幻觉往往源自更深的解码器层。为解决这一问题,我们提出DeLask(Decoder Layer Skipping),一个动态跳过易产生幻觉的层的新型解码框架。DeLask利用了一个理论洞见:$L$层Transformer的前向计算在条件上等价于$L$步梯度下降。我们通过计算相邻解码器步骤所导出梯度之间的余弦相似度来定义“漂移值(driftance value)”,当下降方向发生反转时即识别出问题层。DeLask并不完全丢弃这些层,而是将其隐藏状态与前面的层部分聚合,从而在抑制错误信号的同时保持一致性。跨多种LLM和基准的大量实验表明,DeLask持续缓解幻觉并提升整体可靠性,为提高大规模语言模型的鲁棒性提供了一个轻量且可泛化的解码框架。
