论文
思想没有系统性?评估规则归纳任务的推理模型
Thought without systematicity? Evaluating reasoning models on rule induction tasks
摘要
人类认知的一个核心原则是系统性,这一原则是理解一个概念本质上与理解该概念的密切变化联系在一起。推理模型是否能够稳健地表现出这种系统性?如果是这样,我们期望同一任务的结构等效变体具有一致的性能。在这里,我们扩展了认知科学中已建立的规则归纳任务,以评估当前推理模型中思想的系统性。每个任务族都有组合结构,我们用它来通过任务同构(例如重组和替换)创建结构上等效的任务变体。我们发现,尽管能够正确解决任务,但模型在同一任务的结构等效变体上常常会失败。这些发现表明,许多模型行为缺乏系统性,导致很难在评估特定环境之外稳健地建立推理模型的认知能力。