论文

ActReview:反驳引导的训练数据和可操作同行评审生成的评分标准奖励

ActReview: Rebuttal-Guided Training Data and Rubric Rewards for Actionable Peer Review Generation

应用与实践科学研究

摘要

随着 LLM 越来越多地用于提交前自我审查,对反馈的需求也越来越大,这些反馈不仅可以识别弱点,还可以指导作者进行具体修改。我们将其研究为可操作的同行评审生成,并将其分解为两个子任务:诊断声明生成和修订建议生成。我们引入了 ActReview,这是一个反驳引导的 后训练 框架,它将论文特定的诊断与具体的、有依据的修订计划联系起来。我们的核心观点是,作者的反驳揭示了解决审稿人担忧的合理行动,因此可以为以修订为导向的反馈提供潜在的监督。根据 OpenReview 上真实的审稿反驳线索,我们通过将审稿人的弱点与作者的反应结合起来,并将最终的反馈基于本地化的论文证据,构建了 ActReview-40K。我们使用多任务监督的 微调 对 Qwen3-8B-Base 进行后训练,然后使用候选者感知、针对弱点的奖励规则进行 GRPO 训练。我们还引入了 ActReview-Bench,这是一个由 1,000 个实例组成的人工基准测试,用于评估诊断质量和修订有效性。实验表明,ActReview 在可操作性和基础性方面优于先前的专门评论生成模型,同时与基于强大提示的 LLM 保持竞争力。人工评估证实了修订有效性的提高,同时揭示了技术准确性方面的剩余差距,并且额外的分析支持对已发表论文的概括以及独立法官的稳健性。