论文

解耦 LLM 中的欺骗与幻觉失败

Disentangling Deception and Hallucination Failures in LLMs

模型评测模型行为与机制分析

摘要

大语言模型(LLM)的失败常从行为视角分析,事实问答中的错误输出通常被归因于知识缺失。本工作聚焦基于实体的事实查询,指出这种视角可能混淆不同失败机制,并提出一种内部的、面向机制的视角,将“知识存在”与“行为表达”分开。在此表述下,幻觉与欺骗对应两种性质不同的失败模式,它们在输出层面可能相似,但底层机制不同。为研究这一区分,我们为以实体为中心的事实问题构建受控环境,其中知识保持不变而行为表达被选择性改变,从而可系统分析四种行为情形。我们通过表征可分性、稀疏可解释性和推理时激活导向来分析这些失败模式。

解耦 LLM 中的欺骗与幻觉失败
图 6:基于 SAE 的可解释性分析。通过将稀疏自动编码器应用于瓶颈表示来识别稀疏特征。左:维恩图显示与不同行为案例相关的稀疏特征的数量,其中重叠表示跨多个分类激活的特征。右:不同行为情况下已识别稀疏特征的激活模式,其中横轴索引 32,768 32{,}768 个特征,纵轴表示它们的激活频率。