论文

字典,而不是达尔文:在科学方程发现中,集合级选择击败了 LLM 进化

Dictionaries, Not Darwin: Set-Level Selection Beats LLM Evolution in Scientific Equation Discovery

应用与实践科学研究

摘要

大语言模型 越来越多地用作科学发现的进化引擎:产生候选者,选择获胜者,将他们反馈为父母,然后重复。我们审核这个循环是否实际上复合了科学方程发现中的发现,在这种情况下,有限的样本使得结构不确定并且插值变得容易。在匹配的 LLM 调用预算下,父条件进化与新的独立采样无法区分:中值 OOD NMSE 为 0.045 与 0.049,指示的多父交叉更差,最终成功由初始提案质量预测,并且多个迭代方案无法添加已解决的问题。在操作上,循环简化为它生成的内容:候选术语的字典。我们将这种诊断转化为 PTB-Search,这是一种用于组件化科学发现的一代方法。 PTB-Search 对独立的 LLM 提案进行一次采样,将可重用术语提取到每个问题的字典中,并使用最小二乘系数执行仅训练集级别的稀疏选择。其核心原则是,不确定的数据识别术语集的联合行为,而不是可靠的每术语信用。在相同的字典和零额外的 LLM 调用上,集合级选择器解决 717 个单元格中的 165--169 个,而单项缩减仅解决 74--78 个。在官方的 239 个问题 LLM-SRBench 拆分中,PTB-Search 使用 Llama-3.1-8B 达到了 73.2% Acc0.1,使用单种子 DeepSeek-V4 锚点达到了 77.0%,而使用标准化呼叫预算的十分之一,则最佳报告基线达到了 49.2%。程序域压力测试给出了一个范围边界:生成计数仍然不可靠,而保留的外部状态可以在更困难的非线性空间中提供帮助。从这些结果来看,LLM 最好被理解为材料供应商;发现是通过可重用组件的外部集级别选择来实现的。