论文

以对抗性快速变化的现实领域测试AI科学家的能力

Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities

模型评测评测方法与指标

摘要

评估人工智能科学家生成新颖想法的能力是一个困难的问题。在这一领域,现有的基准测试已经取得了一些进展,但在评估科学推理和研究重复性方面取得了进步,但通常依赖于合成任务或回顾性目标,这些可能受到先前暴露的影响。我们假设,在专家实践者独立生成可观察输出的复杂、对抗性的、快速变化的实际世界环境中,可以提供一个实用的方法来填补这一差距,并评估人工智能科学家所需的能力,包括推理能力、新颖性和假设形成能力。我们在两个结构性不同的领域中实例化了这个框架:F1(Formula 1),模型围绕2026赛季的汽车设计概念进行构思,并且有真实的世界创新作为基准;MTG(Magic: The Gathering),模型从最近更新的卡池中提出套牌,然后与19场巡回赛(Pro Tour, PT)套牌中的108个新卡进行比较。在两个领域中,模型都产生了可接受的输出,但很少与真正的专家解决方案相匹配。在F1中,GPT-5.2模型匹配了40个真实创新中的10个,并且在运行过程中提出了166个想法。在MTG中,Gemini 3 Flash模型从第三名巡回赛(Pro Tour, PT)套牌中恢复了7个新卡中的5个,并且在所有108个套牌中,模型选择的最常被PT套牌采用的新卡也是最广泛接受的新卡(皮尔森相关系数ρ= 0.74,p = 0.0003)。这些结果表明,人工智能科学家的关键能力差距在于过滤、优先级排序和连贯新颖性,而不是想法生成。

以对抗性快速变化的现实领域测试AI科学家的能力:论文配图
图 1:模型生成的想法与 2026 年 F1 实际创新之间经人工确认的匹配。行显示真正的创新,按汽车区域分组,列显示一般(整车)和以组件为中心的配置下的每个模型。绿色单元格表示匹配,黄色单元格表示部分匹配,单元格值表示生成的匹配想法的数量。