论文

ReviewGrounder:利用Rubric-Guided、工具集成代理提高评论实质性

ReviewGrounder: Improving Review Substantiveness with Rubric-Guided, Tool-Integrated Agents

应用与实践科学研究

摘要

AI 会议提交的快速增长推动了对 大语言模型 (LLM) 同行评审支持的不断探索。然而,基于 LLM 的审稿人经常会产生肤浅、公式化的评论,缺乏实质性、有依据的反馈。我们将此归因于人工审查的两个关键组成部分未得到充分利用:明确的标准和现有工作中的上下文基础。为了解决这个问题,我们引入了 REVIEWBENCH,这是一个基准评估评论文本,根据来自官方指南、论文内容和人工撰写的评论的特定于论文的评分标准。我们进一步提出 REVIEWGROUNDER,一个以标题为指导、工具集成的多主体框架,将审查分解为起草和证据核验阶段,通过有针对性的证据整合来丰富浅层草稿。 REVIEWBENCH 上的实验表明,REVIEWGROUNDER 使用基于 Phi-4-14B 的起草器和基于 GPT-OSS-120B 的基础阶段,在与人类判断和基于标题的评审质量在 8 个维度上一致方面,始终优于具有更强/更大主干的基线(例如 GPT-4.1 和 DeepSeek-R1-670B)。代码可在 \href{https://github.com/EigenTom/ReviewGrounder}{here} 获取。