论文

LLM能设计高质量实验吗?自主实验设计的综合系统基准

Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design

模型评测基准与评测资源

摘要

AI for Research (AI4Research) 利用人工智能自动化和改进科学研究流程中的科学工作流。虽然实验设计是科学研究过程中的关键阶段,但之前的研究主要集中在代码实现和执行上,忽视了这一阶段的重要性,并且没有基准来评估人工智能在系统性实验设计方面的能力。为了填补这个差距,我们提出了SCOPE(Scientific COmprehensive Planning Evaluation Benchmark),从300篇高质量论文中构建了一个来自顶级会议(如ICML、NeurIPS和ICLR)的19个研究领域的最新论文,评估LLMs在两个维度上的性能:高阶规划完整性(主要实验、去模态实验和分析实验)和低阶配置准确性和合理性(数据集、基准和度量)。基准测试揭示了三个发现:(1)大多数LLMs无法直接设计高质量的实验;(2)所有LLMs都表现出在底层配置上的性能瓶颈;(3)搜索模式并不能提高设计质量。此外,为了应对这些挑战,我们提出了OptED(Novel Agentic Workflow),一种优化基于LLM的实验设计的新方法,通过阶段隔离、工具增强和规则约束来增强LLM的实验规划,有效地缓解了配置瓶颈。

LLM能设计高质量实验吗?自主实验设计的综合系统基准:论文配图
图 7:拟议的 OptED 框架概述。该工作流程由三个上下文独立的阶段(配置、协议和报告)组成,每个阶段都在“思考-行动-观察”范式下运行。共享工具层提供用于外部知识获取的搜索和浏览功能,以及用于实验资产结构化管理的原子内容编辑界面。行为规范指导每个阶段的决策以确保可重复性。