论文

当前智能体能弥合发现-应用鸿沟吗?Minecraft 案例研究

Can Current Agents Close the Discovery-to-Application Gap? A Case Study in Minecraft

智能体系统Agent任务评测

摘要

发现因果规律并将其应用于构建功能系统——即“发现到应用”循环——是通用智能的标志,然而科学发现与现实世界工程之间巨大的复杂度鸿沟一直阻碍着对这种能力的评估。我们提出 SciCrafter,一个基于 Minecraft 的基准,通过参数化的红石电路任务将该循环操作化。智能体必须按指定模式点亮灯(例如同时点亮或按定时序列点亮);扩大目标参数会大幅增加构建复杂度和所需知识,迫使其进行真正的发现而非依赖记忆中的解法。在通用代码智能体脚手架下评估包括 GPT-5.2、Gemini-3-Pro 和 Claude-Opus-4.5 在内的前沿模型,我们发现所有模型的成功率都停滞在约 26%。为诊断这些失败,我们将该循环分解为四种能力——知识缺口识别、实验发现、知识巩固与知识应用——并设计针对性干预,其边际贡献可作为相应缺口的代理指标。我们的分析揭示,尽管通用的知识应用能力仍是所有模型最大的缺口,但对前沿模型而言,知识缺口识别开始成为主要障碍——这表明当前 AI 的瓶颈正从“正确地解决问题”转向“提出正确的问题”。我们发布 SciCrafter,作为未来研究能够走完完整“发现到应用”循环的 AI 系统的诊断探针。

当前智能体能弥合发现-应用鸿沟吗?Minecraft 案例研究:论文配图
图 1:分解 SciCrafter (Gemini-3-Pro) 内发现到应用循环中的性能差距。最好的模型仅取得 26.0% 的成功。我们将循环分解为四个能力差距:知识识别(预言机提示要发现什么,将成功率提高到 52.5%)、实验发现(科学家子代理进一步达到 64.0%)、知识整合(结构化模板优于自由格式摘要)和应用程序能力(剩余 36% 的差距)。所有型号请参见表 1。