论文
LLM能设计高质量实验吗?自主实验设计的综合系统基准
Can LLM design high-quality experiments? A Comprehensive and Systematic Benchmark on Autonomous Experimental Design
摘要
AI for Research (AI4Research) 利用人工智能自动化和改进科学研究流程中的科学工作流。虽然实验设计是科学研究过程中的关键阶段,但之前的研究主要集中在代码实现和执行上,忽视了这一阶段的重要性,并且没有基准来评估人工智能在系统性实验设计方面的能力。为了填补这个差距,我们提出了SCOPE(Scientific COmprehensive Planning Evaluation Benchmark),从300篇高质量论文中构建了一个来自顶级会议(如ICML、NeurIPS和ICLR)的19个研究领域的最新论文,评估LLMs在两个维度上的性能:高阶规划完整性(主要实验、去模态实验和分析实验)和低阶配置准确性和合理性(数据集、基准和度量)。基准测试揭示了三个发现:(1)大多数LLMs无法直接设计高质量的实验;(2)所有LLMs都表现出在底层配置上的性能瓶颈;(3)搜索模式并不能提高设计质量。此外,为了应对这些挑战,我们提出了OptED(Novel Agentic Workflow),一种优化基于LLM的实验设计的新方法,通过阶段隔离、工具增强和规则约束来增强LLM的实验规划,有效地缓解了配置瓶颈。
