论文
Soohak:数学家策划的用于评估 LLM 研究级数学能力的基准
Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs
摘要
继前沿 LLM 最近在 IMO 上取得金牌表现之后,社区正在寻找下一个有意义且具有挑战性的目标来衡量 LLM 推理。奥林匹克式问题仅衡量逐步推理,而研究级问题则利用这种推理来推进数学知识本身的前沿,成为一种引人注目的替代方案。然而,研究级数学基准仍然稀缺,因为此类问题很难获取(例如,Riemann Bench 和 FrontierMath-Tier 4 分别包含 25 个和 50 个问题)。为了支持下一代前沿模型的可靠评估,我们引入了 Soohak,这是一个由 64 名数学家从头开始编写的包含 439 个问题的基准。 Soohak 包含两个子集。在挑战子集上,包括 Gemini-3-Pro、GPT-5 和 Claude-Opus-4.5 在内的前沿模型分别达到 30.4%、26.4% 和 10.4%,留下了巨大的空间,而领先的开放权重模型,如 Qwen3-235B、GPT-OSS-120B 和 Kimi-2.5 仍然低于 15%。值得注意的是,除了标准的问题解决之外,Soohak 还引入了一个拒绝子集,该子集探讨了研究数学的内在能力:识别不适定的问题并暂停,而不是产生自信但不合理的答案。在这个子集中,没有模型超过 50%,将拒绝识别为当前模型无法直接解决的新优化目标。为了防止污染,该数据集将于 2026 年末公开发布,在此期间可根据要求提供模型评估。