TasteVal:衡量人工智能系统与人类专家的实验研究品味
TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts
摘要
我们引入了 TasteVal,一个评估前沿模型实验研究品味的基准。我们将研究品味定义为选择有趣的问题来解决、设计实验和解释实验结果的能力。 TasteVal 衡量研究品味的实验成分;给定一个固定的研究问题,我们衡量模型迭代设计实验并从结果中得出结论的能力。我们将实验研究品味运作为计算效率;使用一半的串行实验计算达到与专家相同的分数的研究人员具有两倍的实验品味。因此,实验品味充当了实验计算的乘数,使其成为预测人工智能进展的关键输入。 TasteVal 包含 8 个代表前沿人工智能研发的新颖、具有挑战性、开放式任务。为了将品味与编码能力分开,接受评估的模型充当研究人员,迭代地设计实验,同时固定编码器智能体实现它们并报告其结果。研究人员一直执行,直到 40 H100 小时或 120 个挂钟小时预算用完。我们招募 24 名人类专家,每个任务至少 2 名,并以每个任务的最佳专家尝试作为专家基线。我们评估了 2023 年至 2026 年间发布的 20 个模型。性能最好的模型 Opus 5.5 超出了我们的专家基线,计算乘数为 2.3 倍(95% CI 1.15-4.37),大约是我们基线者平均每次运行成本的 1/30。在 TasteVal 上,自 2025 年 12 月以来,前沿模型的计算乘数大约每 3.0 个月翻一番(95% CI 1.7-5.0),而 2023 年至 2025 年 12 月期间每 14 个月增加一倍。通过最终标准化性能衡量,前沿模型没有显示趋势突破,每 14.6 个月翻一番。为了保持 TasteVal 不受污染,我们不会发布任务。
