论文
AI 编码智能体 可以重现社会科学发现
AI Coding Agents Can Reproduce Social Science Findings
摘要
最近的轶事证据表明,在提供原始数据和代码时,AI 编码智能体 可以重现已发表的发现;然而,跨社会科学的系统评估仍然有限。现有的评估基准不够充分,要么很小,要么将代理性能与复制材料本身的问题(例如无法正确执行的代码)混为一谈。在这里,我们介绍了 SocSci-Repro-Bench,这是一个跨越 4 个学科和 13 个实质性领域的 221 项任务的基准,由研究构建而成,这些研究的结果要么可以用可用材料完全重现,要么由于缺失数据而明显不可重现,使我们能够隔离代理的复制能力。评估两个前沿 编码智能体:Claude Code 和 Codex,我们发现两者都可以重现大部分社会科学发现,其中 Claude Code 大大优于 Codex。这些再现率大大超过了之前在可比再现性基准上报告的基于通用 LLM 的代理的再现率。两种智能体在需要识别潜在研究问题的推理任务上也表现出色,并且额外的分析表明结果并非主要由记忆驱动。提供原始纸质 PDF 和复制材料可以适度提高性能,但会导致对无法复制的任务产生偏见。我们还表明,可以通过微妙的提示框架推动智能体进行确认性规范搜索。总之,这些发现表明,至少一些前沿 编码智能体 可以充当计算工作流程的可靠执行者,同时强调随着人工智能系统在科学生产中发挥更大作用,需要仔细的基准测试和及时设计。