论文
解耦 LLM 中的欺骗与幻觉失败
Disentangling Deception and Hallucination Failures in LLMs
摘要
大语言模型(LLM)的失败常从行为视角分析,事实问答中的错误输出通常被归因于知识缺失。本工作聚焦基于实体的事实查询,指出这种视角可能混淆不同失败机制,并提出一种内部的、面向机制的视角,将“知识存在”与“行为表达”分开。在此表述下,幻觉与欺骗对应两种性质不同的失败模式,它们在输出层面可能相似,但底层机制不同。为研究这一区分,我们为以实体为中心的事实问题构建受控环境,其中知识保持不变而行为表达被选择性改变,从而可系统分析四种行为情形。我们通过表征可分性、稀疏可解释性和推理时激活导向来分析这些失败模式。
