论文

E3:自动化研究批评的问题级回测

E3: Issue-Level Backtesting for Automated Research Critique

应用与实践科学研究

摘要

我们推出了 E3,一种自动审稿助手,可通过识别研究论文中与决策相关的技术问题来增强审稿人和工程团队的能力。对于每个问题,E3 报告其性质、位置、对贡献的影响以及解决问题的分析或证据,涵盖不受支持的主张、缺失的消融、弱基线、隐藏的假设、有效性威胁和泄漏风险。为了在没有污染混淆的情况下评估 E3,我们采用问题级回测协议:语料库仅限于每个自动化来源的训练截止日期后的论文,并且对于每篇论文,仅观察匿名评论的元法官将每个问题-来源对标记为“已捕获”、“部分”或“错过”。应用到 100 篇 ICLR 2026 论文和 4598 个已评判的问题行,将 E3 与 ICLR 人类评论以及基于 OpenAI 的 gpt-5.4 和 Anthropic 的 claude-opus-4-6 构建的两个即时匹配的 LLM 基线进行比较,并使用元评判 gpt-5.5,E3 在每个聚合指标上都获得了最高的召回率。部分包含召回率达到 90.2%,比 GPT 高 15.5 个百分点,比 Claude 高 17.1 个百分点,比人工审查高 29.2 个百分点,严格召回率将排序保持在 65.8%。根据人工审核员提出的问题,E3 恢复了 89.6%;出于对人工审核员错过的担忧,被判定的联合中还添加了 1635 行,比第二最佳来源高出 406 行。发布语料库、基线提示、判断提示模板、评估代码。