论文

LLM准备好科学发现了吗:面向AI科学家的能力导向基准

Are LLMs Ready for Scientific Discovery? A Capability-Oriented Benchmark for AI Scientists

模型评测基准与评测资源

摘要

既有的科学数据分析基准主要以代码执行或工作流完成度评估LLM,忽略了科学分析旨在支撑不同类型的科学论断:假设探索、统计推断、机制解释——各有不同的假设与效度标准。我们提出SDABench:一个围绕六种能力(描述性、探索性、推断性、预测性、因果与机制性)在五个领域(生物、化学、环境、地理、物理)重组评估的基准。SDABench含527个真实数据实例(SDA-Real)与6,000个合成实例(SDA-Synth),各含选择题与开放式两种形式,经自动化管线构建。评估15个代表性LLM发现:模型善长描述性分析,但在需要假设选择、潜过程建模或机制推理的任务上急剧退化。SDABench进一步提供五阶段错误分析框架定位LLM失败之处:更先进的模型更可靠地识别相关范围与变量,但仍难以选择适当的分析程序、建模变量关系并得出有效结论。

LLM准备好科学发现了吗:面向AI科学家的能力导向基准:论文配图
图 1:SDA-Synth 构建流程。