论文
大语言模型中涌现的人类式语义记忆觅食策略
Emerging Human-like Strategies for Semantic Memory Foraging in Large Language Models
摘要
人类与大语言模型(LLM)都存储庞大的语义记忆库。对人类而言,高效且有策略地访问该记忆库是多种认知功能的关键基础。这种访问长期以来是心理学的焦点,其背后的计算机制如今已被充分刻画。许多认识来自一项广泛使用的神经心理学与认知科学测验——语义流畅性任务(SFT),它要求生成尽可能多的受语义约束的概念。我们的目标是运用机制可解释性技术,为 LLM 语义记忆觅食研究带来更高的严谨性。为此,我们以 SFT 为案例给出初步结果。核心关注是生成式记忆搜索的聚合与发散模式,它们在人类的高效记忆觅食中扮演互补的策略角色。我们表明,这些对人类 SFT 表现至关重要的行为特征,也在 LLM 的不同层中作为可识别模式涌现。这一分析有望为如何让 LLM 在认知上更贴近人类,或相反地引导其产生有成效的认知去对齐以增强人机交互中的互补优势,提供新的洞见。
