论文
NLPCC 2026 共享任务 11 概述:基于智能体的科学论文实验重现
Overview of the NLPCC 2026 Shared Task 11: Agent-Based Experiment Reproduction from Scientific Papers
摘要
可重复性对于科学进步至关重要,但科学出版物的数量和复杂性不断增加,使得详尽的手动验证变得越来越不切实际。尽管 大语言模型 (LLM) 代理的最新进展实现了自动化实验再现,但现有的评估主要集中在最终存储库上,并且通常仅限于机器学习 (ML)。我们引入了 AgentActionBench,这是一个面向流程的基准,用于评估跨 ML 和 AI4Science 领域的基于代理的实验再现。我们的框架使用基于 MCP 的动作记录器来捕获代理在整个复制过程中的行为,并使用特定于纸张的规则评估结果跟踪。 AgentActionBench 包含 150 篇论文,其中 120 篇 ML 论文和 30 篇 AI4Science 论文。覆盖 10% 基准的人工注释子集提供验证数据,而模型辅助增强将完整基准扩展至超过 10,000 个标题项。实验结果表明,当前系统仍然有限,执行是主要瓶颈。同时,模型生成的评分标准和人工注释的评分标准之间强大的 Pearson 和 Spearman 相关性验证了我们可扩展的评分标准生成方法的可靠性。