论文
无尽考试:从当今模型迈向超级智能的数学构造
The Endless Exam: Mathematical Constructions from Today's Models toward Superintelligence
摘要
我们提出 Endless Exam,一个通过十四类参数化构造族来衡量当今模型在数学上向人工超级智能(ASI)进展程度的基准。每个提交对象都会被自动检查有效性,并对照已发表的前沿结果或构造基线获得相对质量评分,且改进不设以 1 为上限。这些构造族以开放数学问题作为长期目标,并在更大参数规模上生成新实例,借助紧凑证书使大型构造仍可验证。在 69 个不同实例上对八个模型的评估中,连续的质量评分能够区分模型表现,尽管没有任何被评估系统超越已发表的前沿结果。规模-质量曲线展示了构造质量如何随问题规模增大而变化。我们发布生成器、验证器、参考答案、模型响应与分析,以支持在人类前沿之前及之后持续开展测量。