论文

DeepReviewer 2.0:面向可审计科学同行评审的可追溯Agentic系统

DeepReviewer 2.0: A Traceable Agentic System for Auditable Scientific Peer Review

应用与实践科学研究

摘要

自动同行评审常被框定为生成流畅的批评意见,但审稿人和领域主席需要可审计的判断:关切适用于何处、什么证据支持它、需要什么具体后续行动。DeepReviewer 2.0是一个围绕输出契约构建的过程受控Agentic评审系统:它产出带锚定标注、定位证据和可执行后续动作的可追溯评审包,且仅在满足最低可追溯性和覆盖预算后导出。具体而言,它先构建仅基于稿件的声明-证据-风险台账和验证议程,然后执行议程驱动的检索,并在导出闸门下撰写锚定批评。在134份ICLR 2025投稿上、按三种固定协议,一个未经微调的196B模型运行DeepReviewer 2.0优于Gemini-3.1-Pro-preview,将严格主要问题覆盖率从23.57%提升至37.26%,并在对人评审委员会的微平均盲评对比中赢得71.63%,在本文池中的自动系统中排名第一。我们将DeepReviewer 2.0定位为辅助工具而非决策代理,并指出伦理敏感检查等仍存在的差距。

DeepReviewer 2.0:面向可审计科学同行评审的可追溯Agentic系统
图2:作为智能体式认知链的DeepReviewer 2.0概览。阶段I将PDF解析为带锚点的单元,并构建主张–证据–风险(claim–evidence–risk)台账以及调查议程。阶段II执行议程驱动的验证(包括同设置文献比较),并撰写带严重程度与具体修复动作的锚定批注。最终综合在导出评审包之前设有门控。