论文
以对抗性快速变化的现实领域测试AI科学家的能力
Adversarial Fast-Moving Real-World Domains as Test Beds for Benchmarking AI Scientist Capabilities
摘要
评估人工智能科学家生成新颖想法的能力是一个困难的问题。在这一领域,现有的基准测试已经取得了一些进展,但在评估科学推理和研究重复性方面取得了进步,但通常依赖于合成任务或回顾性目标,这些可能受到先前暴露的影响。我们假设,在专家实践者独立生成可观察输出的复杂、对抗性的、快速变化的实际世界环境中,可以提供一个实用的方法来填补这一差距,并评估人工智能科学家所需的能力,包括推理能力、新颖性和假设形成能力。我们在两个结构性不同的领域中实例化了这个框架:F1(Formula 1),模型围绕2026赛季的汽车设计概念进行构思,并且有真实的世界创新作为基准;MTG(Magic: The Gathering),模型从最近更新的卡池中提出套牌,然后与19场巡回赛(Pro Tour, PT)套牌中的108个新卡进行比较。在两个领域中,模型都产生了可接受的输出,但很少与真正的专家解决方案相匹配。在F1中,GPT-5.2模型匹配了40个真实创新中的10个,并且在运行过程中提出了166个想法。在MTG中,Gemini 3 Flash模型从第三名巡回赛(Pro Tour, PT)套牌中恢复了7个新卡中的5个,并且在所有108个套牌中,模型选择的最常被PT套牌采用的新卡也是最广泛接受的新卡(皮尔森相关系数ρ= 0.74,p = 0.0003)。这些结果表明,人工智能科学家的关键能力差距在于过滤、优先级排序和连贯新颖性,而不是想法生成。
