论文

MathConstraint:自动生成 LLM 的经过验证的组合推理实例

MathConstraint: Automated Generation of Verified Combinatorial Reasoning Instances for LLMs

模型评测基准与评测资源

摘要

我们引入了 MathConstraint,这是一个硬性的自适应基准,用于评估 LLM 的组合推理能力。我们将约束满足问题与严格的基于求解器的验证相结合,并设计一个自适应生成器来创建随着 LLM 推理能力的提高而仍然具有挑战性的实例。与在固定数据集上快速饱和或使用 LLM 作为法官来检查解决方案的现有基准不同,MathConstraint 使用参数化问题类型,能够可扩展地生成任意困难且自动可验证的实例。我们发布了 MathConstraint-Easy($266$ 实例),其前沿模型的准确度达到 $72.6% (gemini-3.1-flash-lite) 和 $87.6% (gpt-5.5) 之间,以及 MathConstraint($329$ 实例),其相同模型的精度降至 $18.5% (claude-4.6-sonnet) 和 $66.9% 之间(gpt-5.5) 准确性,展示了我们的基准生成器针对 LLM 推理能力快速进步的弹性。我们评估了 12 个前沿和开放权重模型,无论是否可以访问包含通用 SAT/SMT 求解器的沙盒 Python 环境。工具访问使 MathConstraint 的前沿精度大致翻倍(平均 $+28$pp;claude-4.6-sonnet 高达 $+52$pp)。此外,将工具调用预算从8轮减为4轮会使准确率最多下降37个百分点——大多数单一预算基准都忽略了这一敏感性。我们发布了生成器、数据集和评估工具,作为一个强大的环境,用于研究在对抗性可调难度下的组合推理和工具使用行为。