论文

ComBench:奥赛级组合数学中严格证明推理与构造性实现的基准

ComBench: A Benchmark for Rigorous Proof Reasoning and Constructive Realization in Olympiad-Level Combinatorics

模型评测基准与评测资源

摘要

组合数学是奥林匹克级数学问题解决的核心,需要深入的离散推理、创造性的构造和严格的结构洞察力。最近的证据表明,即使是当今最强大的前沿模型在奥林匹克组合数学上仍然不平衡,揭示了创造性数学推理的差距。我们推出了 ComBench,这是一个奥林匹克级别的组合基准,用于评估和诊断大型语言模型的组合推理能力。 ComBench 包含 100 个人工注释的竞赛级问题,围绕两个互补的设置进行组织:以分析为中心的问题,主要需要严格的数学论证;以及以构造为中心的问题,除了正确性论证外,还需要明确的构造。该评估协议将标题引导的证明分级与确定性构造验证相结合,揭示了证明质量和构造有效性存在差异的情况。对前沿开源和闭源模型的实验表明,ComBench 远未饱和:最强模型达到整体 Avg 的 65.4%。 Best@4 总体得分为 75.3%。我们进一步发现,严格证明推理和构造性实现是不同的功能:Kimi-K2.6 在以分析为中心的证明评分上落后于 GPT-5.5,但在以构造为中心的 Best@4 上超过了 GPT-5.5,而存在和构造问题在代表性前沿模型中始终是最难的。

ComBench:奥赛级组合数学中严格证明推理与构造性实现的基准:论文配图
图 1:IMO 2025 P6,所有评估模型均未解决的具有挑战性的组合问题。该图显示了原始问题陈述、参考答案以及参考结构的示意图。