论文
Watson & Holmes:一个比较人类与 LLM 推理的自然情境基准
Watson & Holmes: A Naturalistic Benchmark for Comparing Human and LLM Reasoning
摘要
现有 AI 推理基准难以说明这些能力在自然情境中与人类推理的接近程度。我们将 Watson & Holmes 侦探桌面游戏改编为新基准,使用逐步呈现的叙事证据、开放式问题和不受约束的语言回答来评估推理表现。我们开发了自动评分系统并针对人类评审进行验证,从而实现可扩展、可复现的表现评估。结果显示 AI 模型表现随时间明显提升。在 2025 年的九个月内,模型表现从人类对照组的下四分位上升到约前 5%。约一半的提升来自 successive 模型发布的稳步进步,其余则对应与推理导向模型架构相关的显著阶跃变化。就具体侦探谜题特征而言,AI 模型与人类表现的系统性差异大多不存在,例外有二:模型在解较长案件(案件长度在 1900-4000 词之间)时表现下降;以及推理型模型在案件求解早期证据稀少时归纳推理占优。