论文

先探索再归纳:用语言模型高效测量并发现科学规律

Explore, Then Commit: Measurement-Efficient Scientific Law Discovery with Language Models

智能体系统Agent 规划

摘要

科学定律的发现需要选择测量并将证据转化为控制方程。我们评估了一个探索然后提交的协议,其中大语言模型提出假设,程序规划器收集测量结果,并且新的提示从固定的观察结果中合成最终定律。该协议结合了结构化 探针、自动数值诊断、限制测量批次和可选的解释器访问。在 576 次 NewtonBench 试验中,我们使用 GPT-4.1-mini 和中等难度的 GPT-4.1 复制比较了 12 个物理模块上的 8 个配置。在中等任务中,支持解释器的计划者在 GPT-4.1-mini 的每次试验中使用 8.6 与 22.5 的测量值,在 GPT-4.1 的每次试验中使用 8.9 与 43.0 的测量值。它们基于平均幅度的均方根对数误差分别从 2.514 降至 0.202 和从 0.626 降至 0.149。额外的审核会在覆盖范围敏感的分析中保留不完整和无效的提交内容。观察到的符号准确性增益在各个模块之间不太一致,并且随机获取与分歧评分具有竞争力。每个模块都可以节省测量数据,但不平等的批次限制无法将其仅归因于采集质量。这些结果支持完整的协议作为一种有前景的测量高效配置,同时其因果组件和泛化超出了无噪声直接方程任务尚未解决。

先探索再归纳:用语言模型高效测量并发现科学规律:论文原图
图 S1:每个模块和配置的中等任务符号准确度百分比。每个单元格包含两个 执行轨迹,因此单个改变的结果会将其移动 50 点。 N和C表示没有口译员和口译员访问; Var、Pair、Rand 表示获取规则。颜色编码显示的百分比,而不是置信度。