论文

从数据到理论:面向材料科学的自主大语言模型智能体

From Data to Theory: Autonomous Large Language Model Agents for Materials Science

应用与实践科学研究

摘要

我们提出一个用于端到端、数据驱动的材料理论构建的自主大语言模型(LLM)智能体。该模型能够选择方程形式、生成并运行自己的代码,并在无人工干预的情况下检验理论与数据的匹配程度。该框架将逐步推理与专家提供的工具相结合,使智能体能够按需调整方法,同时清晰记录其决策。对于Hall-Petch方程和Paris定律等成熟的材料关系,智能体能正确识别控制方程,并在新数据集上做出可靠预测。对于更专门的关系,例如共轭分子HOMO-LUMO能隙随长度变化的Kuhn方程,性能更依赖于底层模型,其中GPT-5能更好地恢复出正确方程。在已知理论之外,智能体还能提出新的预测关系,文中以HOMO-LUMO能隙变化的应变依赖定律为例加以说明。同时,结果表明仔细验证仍然必不可少,因为即使数值拟合看似良好,智能体仍可能给出错误、不完整或不一致的方程。总体而言,这些结果凸显了自主LLM智能体在AI辅助科学建模与发现上的前景及当前局限。

从数据到理论:面向材料科学的自主大语言模型智能体:论文配图
图 1:三组件自主拟合框架的示意图,说明了闭环迭代工作流程。推理引擎、工具注册表和代理状态通过包含思想、行动和观察步骤的闭环迭代工作流程进行交互。