论文
判断代理缩小了人工智能生成的科学模拟的可靠性差距
A Judge Agent Closes the Reliability Gap in AI-Generated Scientific Simulation
摘要
大语言模型 可以生成科学模拟代码,但生成的代码在大多数非教科书问题上失败。我们证明了经典的数学验证——适定性、收敛性和错误认证——可以由判断代理完全自动化,将跨越 12 个科学领域的 134 个测试用例的静默失败率从 42% 降低到 1.5%。标题结果来自一项前瞻性基准:由 12 位独立科学家提交的 72 项盲法任务,在有自动错误界限的情况下,成功率为 89%(95% CI:[80%,95%]),而没有法官的成功率为 53%。在临床 CT(唯一动力实验,n = 200)上,管道达到了 99% 的专家质量。剩余的 1.5% 集中在可验证性失效的分叉点。我们通过可模拟性等级 S 形式化了这个边界,并引入了spec.md,这是一种结构化规范格式,使任何科学计算问题都变得机器可读且独立于求解器。代码、数据和所有 72 个基准测试任务均公开存档。