论文

AI科学家产出结果却未进行科学推理

AI scientists produce results without reasoning scientifically

模型评测智能体系统Agent Harness模型行为与机制分析

摘要

基于大语言模型(LLM)的系统正越来越多地被部署用于自主开展科学研究,然而其推理是否遵循使科学探究得以自我修正的认识论规范,人们对此知之甚少。在这里,我们通过超过25,000次智能体运行和两个互补的视角,对跨八个领域、涵盖工作流执行到假设驱动探究的LLM科学智能体进行评估:(i) 将基础模型与智能体脚手架的贡献进行分解的系统性性能分析;(ii) 对智能体推理的认识论结构的行为分析。我们观察到,基础模型是性能与行为的首要决定因素,解释了41.4%的方差,而脚手架仅为1.5%。在所有配置中,证据在68%的轨迹中被忽视,由反驳驱动的信念修正仅出现在26%的情形中,而收敛的多测试证据很罕见。无论智能体执行计算工作流还是开展假设驱动探究,都出现相同的推理模式。即使智能体获得近乎完整的成功推理轨迹作为上下文,这些模式依然持续存在,且由此产生的不可靠性会在认识论要求苛刻的领域中随重复试验而复合累积。因此,当前的LLM智能体能够执行科学工作流,但并未表现出表征科学推理的认识论模式。基于结果的评估无法检测这些失败,而仅靠脚手架工程也无法修复它们。除非推理本身成为训练目标,否则此类智能体产出的科学知识无法由产生它的过程来证成。

AI科学家产出结果却未进行科学推理:论文配图
图 1:跨认知需求和问题范围对科学推理进行基准测试。 (A) 作为语言决策过程的代理。基本LLM政策通过代理支架(例如推理、反思、工具使用)进行增强,以形成通过迭代行为观察循环与科学环境交互的代理。 (B) 大规模评估是我们研究结果的基础。该基准包括在 15 多个环境范围内运行的 25,000 多个代理和 90 多个工具,从而能够对模型和支架贡献进行基于统计的评估。 (C) 机制和认识论分析揭示了失效模式。我们通过轨迹的机械分析和推理过程的认识论分析来分析代理行为。 (D) 环境是沿着认知需求不断增加的轴(从左到右)组织的。工作流程执行任务(例如分子模拟、吸附表面构建、基于 ML 的属性预测、AFM 实验执行)强调程序的正确性;战略推理任务(例如逆合成规划)需要在约束下进行多步骤规划;假设驱动的探究任务(例如光谱结构阐明、无机定性分析、电路推理)需要生成、测试和修改竞争假设。在每个域中,任务范围通过扩展搜索空间的分级配置(sn →\rightarrow sn+1)来增加。轴标签 WE 和 E 标记工作流程执行和证据锚点; H、G 和 P 标记假设、目标和协议锚点; T、J、U表示测试、判断、更新操作。