论文
虚假模式感知如何驱动语言模型推理幻觉
Illusory Pattern Perception Drives Spurious Inference in Large Language Models
摘要
错觉模式感知是一种有据可查的人类认知倾向,可以推断实际上随机的数据中有意义的关系。这种趋势通常被描述为“将不存在的点连接起来”,可能会导致系统性推理错误。本文研究了大语言模型 (LLM) 是否表现出这种感知倾向,这可能导致下游应用程序中的系统错误。据我们所知,这项工作首次对 LLM 中的幻觉模式感知进行系统研究,将经典心理学范式应用于三项任务,并与人类行为进行直接实证比较。我们发现 LLM 经常表现出比人类更强的幻觉模式感知。特别是,模型往往将频繁的积极属性与多数群体或大型组织过度关联,并显示出越来越倾向于从模糊事件中构建因果叙述。为了揭示这些行为背后的机制,我们开发了一个基于稀疏自动编码器(SAE)的特征可解释性框架来分析内部表示。我们的结果表明,整体频率感知和分析认知取向与幻觉感知的出现有关。这些发现强调了先前未充分探索的类似认知的错觉,该错觉可能会影响 LLM 推理的可靠性。代码可在 https://github.com/NusIoraPrivacy/illusory. 获取
