论文

大语言模型中涌现的人类式语义记忆觅食策略

Emerging Human-like Strategies for Semantic Memory Foraging in Large Language Models

模型评测模型行为与机制分析

摘要

人类与大语言模型(LLM)都存储庞大的语义记忆库。对人类而言,高效且有策略地访问该记忆库是多种认知功能的关键基础。这种访问长期以来是心理学的焦点,其背后的计算机制如今已被充分刻画。许多认识来自一项广泛使用的神经心理学与认知科学测验——语义流畅性任务(SFT),它要求生成尽可能多的受语义约束的概念。我们的目标是运用机制可解释性技术,为 LLM 语义记忆觅食研究带来更高的严谨性。为此,我们以 SFT 为案例给出初步结果。核心关注是生成式记忆搜索的聚合与发散模式,它们在人类的高效记忆觅食中扮演互补的策略角色。我们表明,这些对人类 SFT 表现至关重要的行为特征,也在 LLM 的不同层中作为可识别模式涌现。这一分析有望为如何让 LLM 在认知上更贴近人类,或相反地引导其产生有成效的认知去对齐以增强人机交互中的互补优势,提供新的洞见。

大语言模型中涌现的人类式语义记忆觅食策略
图1:比较LLM与人类生成的SFT序列。A. 绘制了一个状态转移图,作为对三个类别(非人类灵长类、昆虫、农场动物)如何被认为生成序列的概念性说明。节点之间的箭头表示发散行为,而自边表示趋同。聚类指在特定类别内生成词语,而切换指转移到新类别。B. 表示人类与LLM类别间转移概率的平均状态转移矩阵之间的相关性。C. 比较LLM与人类的类别间及类别内转移概率分布。D. 人类与LLM序列的切换比分布,显示人类切换更频繁(平均切换比0.55)于LLM(平均切换比0.4),表明LLM在切换之前更善于对语义聚类进行穷尽式采样。Mann-Whitney p < 0.0001 p<0.0001 。