论文

NeuroActiSep:单次检测前馈神经元的事实幻觉

NeuroActiSep: Detecting Factual Hallucinations from Feed-Forward Neurons in a Single Pass

模型推理推理验证与自校正

摘要

大型语言模型中的幻觉降低了其可靠性并减慢了采用速度。各种白盒研究使用内部表征来检测真实性和事实性的模式。一种研究较少的方法是识别与幻觉相关的前馈神经元。我们提出了一种使用自定义神经元选择数据集对最终提示标记处的前馈神经元进行排序的方法。我们将选定的神经元身份转移到其他事实问答数据集上训练幻觉分类器。我们的工作提供了经验证据,表明使用所选神经元的特征训练的探针与根据内部状态训练的探针表现相同。我们还分析了所选神经元的分布以及层深度对检测性能的影响。