论文
DASyR-LLM:使用 LLM 进行域感知符号回归,用于动力学模型发现
DASyR-LLM: Domain-Aware Symbolic Regression with LLMs for Kinetic Model Discovery
摘要
动力学模型发现是化学工程中的一个核心挑战,因为准确的速率表达对于理解和控制化学和生物过程至关重要。符号回归(SR)已成为一种强大的数据驱动方法,用于识别可解释的动力学模型,但通常在没有领域知识的情况下进行操作,经常探索物理化学上不可信的模型。 大语言模型 (LLM) 为将领域专业知识注入此搜索提供了一个有前途的途径。在这里,我们引入了一个 LLM 引导的 SR 框架,将 LLM 模块嵌入到迭代 SR 算法中,以实现自动动力学模型发现。 LLM 在每次迭代中执行两个角色:(1)对最佳 SR 候选者进行定性物理化学批评,以及(2)在 SR 生成的模型和嵌入式化学知识的指导下提出新的候选率表达式。我们的框架通过四个复杂性不断增加的计算机案例研究进行了评估,涵盖多相催化和生物过程系统。结果显示,与最先进的 SR 框架相比,LLM 引导框架减少了识别 真值 模型的迭代次数 $41.7-79.3\%$,并且 LLM 在超过一半的引导运行中直接提出正确的模型结构。在实际设置中,每次迭代通常都需要一个新的湿实验室实验,这意味着实验工作量的大幅减少。两种方法在独立验证集上的预测性能相当,在所有案例研究中 $R^2>0.98$。消融研究表明,SR 组件和 LLM 规模都有助于实现这一性能,其中尺寸减小的 LLM 在很大程度上保留了发现效率。这些发现表明,LLM 可以有效地将领域知识注入科学模型发现中,为完全自动化、领域感知的动力学建模流程铺平道路。