论文

Pencil Puzzle Bench:一个多步可验证推理基准

Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning

模型评测基准与评测资源

摘要

我们提出 Pencil Puzzle Bench,一个通过纸笔谜题评估大语言模型推理的框架,这类约束满足问题与 NP 完全问题密切相关,支持确定性的步骤级验证。从包含 94 个品种、62,231 道经验证解唯一谜题的数据库中,我们选出覆盖 20 个品种的 300 道谜题基准,并以两种模式评估来自 11 家提供商的 51 个模型:直接提问(单轮)与 Agentic(带迭代验证的多轮)。该基准的关键差异化在于每个中间盘面都可对照品种特定约束校验,把错误定位到被违反的确切规则,为过程监督与强化学习提供稠密的每步奖励信号基础设施。评估揭示两个不同的能力轴:(1)推理努力扩展,GPT-5.2 从不推理到最大努力提升 81 倍;(2)Agentic 迭代,Claude Opus 4.6 借迭代校验从 0.3% 升至 30.0%,GPT-5.2@xhigh 从 20.2% 升至 56.0%。Agentic 尝试中位数为 17 分钟内 29 轮,最长超过 1,221 轮、14.3 小时——这是对长上下文利用而非仅推理能力的高要求测试。

Pencil Puzzle Bench:一个多步可验证推理基准
图6:基准中的全部20个变体,展示于求解进行中,约束违反以红色高亮。