论文
推理即模式匹配:人类与LLM日常推理中的共享机制
Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning
摘要
当大型语言模型 (LLM) 无法泛化或在推理中出现偶然错误时,通常会被视为 LLM 并未真正进行推理,而是执行某种模式匹配的证据。这意味着人们的行为不会表现出相同类型的失败,因为人类推理使用原则性和抽象的世界模型。我们评估了人类参与者和 25 名大语言模型对各种日常情况进行常识推理的能力,并观察了人和模型中类似的错误模式。然后,我们识别驱动 LLM 响应的一组注意力头,并发现这些头实现了某种形式的模式匹配。这些注意力头使我们能够预测人们由于表面上不相关的提示细节而导致的看似无法解释的推理错误。总而言之,我们的结果表明,人们和大语言模型的日常因果推理更符合模式匹配的形式,而不是抽象的世界模型。
