论文
ReplicatorBench:面向社会科学与行为科学可复制性的LLM Agent基准测试
ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences
摘要
文献中对用于自动评估科学论文的AI Agent的兴趣正日益增长。现有基准主要关注该任务的计算层面,测试Agent在可获取代码与数据时重现(reproduce)或复制(replicate)研究结果的能力。这一设定虽然具有基础性意义,却(1)未能捕捉复制(与重现不同)所面临的新数据可得性不一致问题,(2)因只聚焦可重现论文而缺乏真值多样性,从而无法评估Agent识别不可复制研究的能力。此外,多数基准只评估结果而非复制过程。为此,我们提出ReplicatorBench,一个端到端基准,包含经人工核验的社会与行为科学可复制及不可复制研究论断,用于在三个阶段评估AI Agent的研究复制能力:(1)复制数据的抽取与检索;(2)计算实验的设计与执行;(3)结果解读,从而检验AI Agent在真实世界中模仿人类复制者活动的能力。为给出AI Agent能力的基线,我们开发了ReplicatorAgent,一个配备必要工具(如网络搜索以及与沙盒环境的迭代交互)的agentic框架,用以完成ReplicatorBench中的任务。我们在四个底层大语言模型(LLM)之上,并沿编程语言与代码访问级别的不同设计选择评估ReplicatorAgent。我们的发现表明,当前LLM Agent虽然能够有效地设计与执行计算实验,却在检索复制论断所需的新数据等资源方面举步维艰。所有代码与数据公开于https://github.com/CenterForOpenScience/llm-benchmarking。
