论文

推理即模式匹配:人类与LLM日常推理中的共享机制

Reasoning as Pattern Matching: Shared Mechanisms in Human and LLM Everyday Reasoning

模型评测模型行为与机制分析

摘要

当大型语言模型 (LLM) 无法泛化或在推理中出现偶然错误时,通常会被视为 LLM 并未真正进行推理,而是执行某种模式匹配的证据。这意味着人们的行为不会表现出相同类型的失败,因为人类推理使用原则性和抽象的世界模型。我们评估了人类参与者和 25 名大语言模型对各种日常情况进行常识推理的能力,并观察了人和模型中类似的错误模式。然后,我们识别驱动 LLM 响应的一组注意力头,并发现这些头实现了某种形式的模式匹配。这些注意力头使我们能够预测人们由于表面上不相关的提示细节而导致的看似无法解释的推理错误。总而言之,我们的结果表明,人们和大语言模型的日常因果推理更符合模式匹配的形式,而不是抽象的世界模型。

推理即模式匹配:人类与LLM日常推理中的共享机制:论文配图
图 1:我们探索人类和大语言模型因果推理的评估概述。一个。用于测试人和大语言模型因果推理的评估格式的图示。对于每个提示,受试者首先会看到场景。阅读提示后,受试者按空格键查看两个回答选项,然后选择最有可能的完成选项。 b.我们在评估日常因果推理时使用的 11 个类别的摘要。