论文

VERITAS:迈向科学研究通用复现工具

VERITAS: Towards a General-Purpose Replication Tool for Scientific Research

应用与实践科学研究

摘要

AI工具正在加速科学发表——而审查系统难以跟上——已发表研究的独立验证变得更难也更 重要。由于人工复现缓慢且昂贵——越来越多工作用编码智能体自动化该过程的部分环节。既有成果大多打包为带配套智能体的基准——只能在基准自身管线内运行——尚无通用复现工具。我们提出VERITAS——围绕CLI编码智能体构建的领域无关复现框架。给定论文、代码仓库或两者——VERITAS提取论文声明——在运行方法学的同时解决出现的问题——并对照实验运行产生的证据判断每条声明。该管线返回重要性加权的复现分数(Replication Score)、每项修复的严重度分级日志——以及修补后的代码库。我们在CORE-Bench与ReplicationBench上评估VERITAS——65篇论文横跨计算机科学、社会科学、医学与天体物理。对照同一模型与宿主环境上的两个强Claude Code基线——VERITAS取得最先进性能——并在两个基准的所有指标上领先。

VERITAS:迈向科学研究通用复现工具:论文配图
图 2:Veritas 管道。分析提取结构化声明,计划起草复制程序,复制在解决问题时运行它,评估每次修复的修复率,并使用提取复制值的比较器步骤和分配状态的确定性分级器来验证判断每个声明。判决汇总为重要性加权的复制分数。 Codegen 仅在计划之前以纯纸质模式运行。有界管理器循环在每次复制尝试后读取执行检查,并接受该尝试或发出书面指令,以新的指导重新运行复制(或计划,当计划本身出现问题时)。