论文

BrainBench:揭示大语言模型的常识推理差距

BrainBench: Exposing the Commonsense Reasoning Gap in Large Language Models

模型评测基准与评测资源

摘要

大语言模型(LLM)在标准基准上取得令人瞩目的分数,却常常答错任何人类几秒钟内就能正确回答的问题。我们提出BrainBench,一个包含100道脑筋急转弯问题的基准,覆盖20个精心设计的类别,每个类别针对LLM的一种特定常识推理失败模式。类别范围从隐式物理约束(“我应该步行还是开车把租赁汽车送到归还点?”)到语义范围陷阱与默认假设劫持。我们评估了八个前沿模型——四个来自Claude家族、四个来自GPT家族——采用零样本协议,每个问题独立运行10次。最好的模型是开启扩展思考的Claude Opus 4.6,准确率仅为80.3%;最差的GPT-4o得分为39.7%。即使表现最好的模型,准确率与一致性之间也存在6-16个百分点的差距,暴露出随机性推理。中文跨语言评估显示大多数模型下降2-8个百分点,证实这些失败反映的是推理缺陷,而非语言特有的伪差。BrainBench提供了一个细粒度诊断工具,用于识别LLM在何处以及为何用表面启发式替代真正的常识推理。

BrainBench:揭示大语言模型的常识推理差距:论文配图
图2:各模型在各类别上的准确率热力图,类别按平均难度排序(左难右易),颜色越深表示准确率越低,揭示模型常识推理差异。