论文

EvoMO-SR:具有子结构指导的基于 LLM 的多目标符号表达式演化

EvoMO-SR: Multiobjective LLM-based Evolution of Symbolic Expressions with substructure guidance

应用与实践科学研究

摘要

符号回归 (SR) 是一种数据驱动的科学发现方法,用于搜索数据中可解释的分析关系。最近,大语言模型(LLM)也对科学发现产生了重大影响,实现了该过程各个阶段的自动化。由于这些原因,利用大语言模型嵌入式科学知识和编程能力来解决SR任务的可能性已经出现,与传统方法相比,表现出了良好的性能。我们提出了 EvoMO-SR,一种新颖的 LLM 驱动的 SR 框架,其中 LLM 生成方程骨架,其系数由外部优化器单独拟合。该框架包括通过平衡准确性和复杂性来控制膨胀的多目标生存选择,以及使用候选可重用构建块来改变表达式的子结构指导机制。 EvoMO-SR 使用小型 LLM 模型(即 Llama-3.1-8B-Instruct)在 LSR-Synth 的八个域内和域外设置中的七个中实现了最佳精度。我们还通过基于规范化子树重叠和术语匹配的两个符号准确性指标来评估结构恢复,这表明我们的方法有更大的概率恢复高度准确的符号结构。