论文
大语言模型能在真实世界和平行世界中发现科学规律吗?
Can LLMs Discover Scientific Laws in Real and Parallel Worlds?
摘要
长期以来,科学方程的发现一直是科学进步的核心,在科学约束下通过假设生成、观察测试和完善的迭代循环进行。随着LLM能力的进步及其在科学人工智能中作用的扩大,他们是否能够真正发现科学规律以及如何评估这种能力仍然是一个悬而未决的问题。然而,现有的评估通常要么通过综合设置简化发现,要么重用LLM可能已经熟悉的已发布目标。因此,我们推出 SCILAWS-BENCH,这是根据已发表的研究和真实科学数据构建的科学定律发现基准。它包含从 381 篇科学论文中提取的 118 个问题,涵盖 291 个候选定律和六个科学学科的大约 800 万个真实数据点。每个问题都在两个互补的设置中实例化:(1) SCILAWS-REAL 要求模型从固定的真实观察中提出规律,并评估从源文献中得出的预测拟合和科学有效性,(2) SCILAWS-PARALLEL 要求模型主动查询残差校准的世界并恢复从已发布形式中得出的综合隐藏规律。这种两种设置的任务设计保留了每个问题的科学背景,同时单独评估固定记录定律的发现和新合成的隐藏定律的主动恢复。我们发现,预测拟合可能会偏离科学有效性、记忆形状,无论模型是否再现或超越已发布的公式,并且我们的最佳 N 研究揭示了选择瓶颈。我们的工作为评估人工智能的科学发现提供了基于论文的基准和新的实证视角。项目页面:https://yiyihum.github.io/SciLaws-Bench
