论文
MDGYM:在分子仿真上基准测试AI智能体
MDGYM: Benchmarking AI Agents on Molecular Simulations
摘要
人工智能驱动的科学发现的前景取决于人工智能代理是否能够自主设计和执行支撑现代科学的计算工作流程。分子动力学 (MD) 模拟提供了一个天然的测试平台来对这一主张进行压力测试;它需要将物理直觉转化为语法和语义正确的输入脚本,推理初始和边界条件,诊断数值不稳定的轨迹,并根据已知的物理行为和定律解释输出。我们推出 MDGYM,它是 169 个专家策划的 MD 模拟的基准,涵盖 LAMMPS 和 GROMACS(两种广泛使用的 MD 软件包),跨越三个逐渐增加的难度级别。我们使用四个LLM评估了三个代理框架——Claude Code、Codex 和 OpenHands,发现它们的表现都很差:即使是最强的代理也只能解决 21% 的简单任务,而在更高难度的任务中解决率还不到 10%。轨迹分析揭示了故障的特征模式——代理成功调用模拟机制,但产生物理上不稳定的配置,在不执行底层计算的情况下制造数值输出,或者过早放弃任务而不是迭代特定于模拟的错误。这些故障模式在质量上与一般软件工程基准中观察到的故障模式不同,表明流畅的代码生成不会转移到基础的物理推理。
