论文

TasteVal:衡量人工智能系统与人类专家的实验研究品味

TasteVal: Measuring the Experimental Research Taste of AI Systems Against Human Experts

智能体系统Agent任务评测

摘要

我们引入了 TasteVal,一个评估前沿模型实验研究品味的基准。我们将研究品味定义为选择有趣的问题来解决、设计实验和解释实验结果的能力。 TasteVal 衡量研究品味的实验成分;给定一个固定的研究问题,我们衡量模型迭代设计实验并从结果中得出结论的能力。我们将实验研究品味运作为计算效率;使用一半的串行实验计算达到与专家相同的分数的研究人员具有两倍的实验品味。因此,实验品味充当了实验计算的乘数,使其成为预测人工智能进展的关键输入。 TasteVal 包含 8 个代表前沿人工智能研发的新颖、具有挑战性、开放式任务。为了将品味与编码能力分开,接受评估的模型充当研究人员,迭代地设计实验,同时固定编码器智能体实现它们并报告其结果。研究人员一直执行,直到 40 H100 小时或 120 个挂钟小时预算用完。我们招募 24 名人类专家,每个任务至少 2 名,并以每个任务的最佳专家尝试作为专家基线。我们评估了 2023 年至 2026 年间发布的 20 个模型。性能最好的模型 Opus 5.5 超出了我们的专家基线,计算乘数为 2.3 倍(95% CI 1.15-4.37),大约是我们基线者平均每次运行成本的 1/30。在 TasteVal 上,自 2025 年 12 月以来,前沿模型的计算乘数大约每 3.0 个月翻一番(95% CI 1.7-5.0),而 2023 年至 2025 年 12 月期间每 14 个月增加一倍。通过最终标准化性能衡量,前沿模型没有显示趋势突破,每 14.6 个月翻一番。为了保持 TasteVal 不受污染,我们不会发布任务。

TasteVal:衡量人工智能系统与人类专家的实验研究品味的原论文方法或结果图
图 2:TasteVal 概述。每个任务都包含指令、数据集和评分代码。研究人员(正在评估的模型)查看指令以及训练集和验证集,并决定运行哪些实验;编码器在所有运行中都是固定的,此外还可以查看测试集和评分代码,在单个 H100 上实施每个实验,并报告结果。两名监督员执行编码员-研究员合同,每个方向一名,联络员通过阅读记录来回答研究员关于编码员进度的问题。