论文

Project Euler上的人类与机器数学难度:实验分析

Human vs Machine Mathematical Difficulty on Project Euler: An Experimental Analysis

模型评测模型能力评测

摘要

我们研究前沿AI系统的投入与成功概率如何随Project Euler(计算数学问题在线平台)问题的人类难度扩展。我们的数据集(来自MathArena基准)含50题、26个模型配置的3,840次尝试——题目难度以站点公开的人类解题时间度量。受Timothy Gowers提议启发——我们检验每成功答案生成token成本与人类时间之间的幂律关系t_machine = a·t_human^b——在25个可拟合模型中的20个(含最强基座模型)发现b<1——因此该操作化不支持此前“机器随难度扩展劣于人类”的预测。我们还研究受测问题上的成功概率能否以简单指数衰减p_success = e^(c·t_human)建模——预测log p_success与t_human间的线性关系。用分箱方法聚合数据——我们在22个覆盖最好的配置上发现中等经验支持(箱级R²中位数0.92)。遵循METR——我们还拟合logistic成功曲线并抽取50%任务长度视界h₅₀:2026年4月20日快照中的最强配置在我们最快五人基线上达约2.5-4.3小时——经SOTA前沿的log线性拟合给出SOTA h₅₀约75天的描述性倍增时间。