论文
概念关联差距:LLM 与人类如何以不同方式理解抽象概念
The Grounding Gap: How LLMs Anchor the Meaning of Abstract Concepts Differently from Humans
摘要
抽象概念——正义、理论、可用性——没有单一可感知的指称;在人类大脑中,它们的意义来自于经验、情感和社会背景的网络。 大语言模型 (LLM) 是否以类似的方式基础抽象概念?我们通过在 21 个前沿和开放权重 LLM 上复制认知科学的属性生成实验来研究这一点。在模型和实验中,我们发现了一个一致的模式:与人类相比,模型过于依赖单词关联,而无法产生与情绪和内部状态相关的属性。这产生了一个巨大且一致的基础差距:与人类反应的皮尔逊相关性 r=0.37 相比,没有任何模型超过 r=0.9 以上的人与人之间的上限。为了更好地解释这一差距,我们还复制了概念关联维度的评级实验,发现 LLM 与人类判断更加一致,并且随着模型变大,一致性也会提高。然后,我们使用稀疏自动编码器(SAE)来检查这些信息是否也反映在模型的内部特征中,并且我们确实识别了与“感觉运动”和“社交”等基础维度相关的特征。这些发现表明,当前的 LLM 在明确查询时可以恢复基础维度,但在自由生成单词时不会以类似人类的方式招募它们。