论文

提交-弃权循环:为什么语言模型会产生幻觉而不是弃权

The Commit-Abstain Circuit: Why Language Models Hallucinate Instead of Abstaining

模型评测模型行为与机制分析

摘要

语言模型 (LM) 通常会产生幻觉,承诺给出自信的答案而不是放弃,即使它们没有足够的信息来可靠地回答。大量现有工作通过检测或弃权机制来减轻幻觉,但模型内部如何首先做出承诺或弃权的决定仍然没有解决。我们通过机械分析来研究这个决定,将幻觉视为没有支持的承诺:尽管表现出无法回答的信号,模型还是做出了承诺。使用因果门控,我们确定了提交-放弃电路(CAC),这是一个稀疏的、因果局部的注意力头子集和支持该决策的 MLP 子层。在来自五个系列和三个基准的十个 LM (3B-14B) 中,CAC 表现出一种反复出现的积累但不正确的模式:承诺促进成分在早期层中建立承诺,而弃权促进成分后来充当纠正信号,这些信号通常不足以推翻累积的承诺。基于这一发现,在 CAC 激活上训练的轻量级策略将决策准确性比模型的内在提交弃权裕度提高了 12.2 个百分点,将错误弃权减少了 2.5 倍,转移到看不见的基准,并扩展到更大的模型 (27B-35B)。 CAC 既具有诊断性,可以阐明模型如何过度使用,又具有实用性,可以改进弃权决策。