论文
AI科学家产出结果却未进行科学推理
AI scientists produce results without reasoning scientifically
摘要
基于大语言模型(LLM)的系统正越来越多地被部署用于自主开展科学研究,然而其推理是否遵循使科学探究得以自我修正的认识论规范,人们对此知之甚少。在这里,我们通过超过25,000次智能体运行和两个互补的视角,对跨八个领域、涵盖工作流执行到假设驱动探究的LLM科学智能体进行评估:(i) 将基础模型与智能体脚手架的贡献进行分解的系统性性能分析;(ii) 对智能体推理的认识论结构的行为分析。我们观察到,基础模型是性能与行为的首要决定因素,解释了41.4%的方差,而脚手架仅为1.5%。在所有配置中,证据在68%的轨迹中被忽视,由反驳驱动的信念修正仅出现在26%的情形中,而收敛的多测试证据很罕见。无论智能体执行计算工作流还是开展假设驱动探究,都出现相同的推理模式。即使智能体获得近乎完整的成功推理轨迹作为上下文,这些模式依然持续存在,且由此产生的不可靠性会在认识论要求苛刻的领域中随重复试验而复合累积。因此,当前的LLM智能体能够执行科学工作流,但并未表现出表征科学推理的认识论模式。基于结果的评估无法检测这些失败,而仅靠脚手架工程也无法修复它们。除非推理本身成为训练目标,否则此类智能体产出的科学知识无法由产生它的过程来证成。
