论文
值得信赖的人工智能审稿人缺失的一环:从修辞鲁棒性基准测试到 SciCore 审稿
A Missing Piece for Trustworthy AI Reviewers: From Benchmarking Rhetorical Robustness to SciCore Review
摘要
人工智能审稿人可以对以不同措辞报告相同科学的手稿做出不同的判断,这可能会奖励修辞优化而不是科学改进。我们将修辞鲁棒性表述为内容保留重写和论文间歧视稳定性的联合要求。我们引入了 RobustReview,这是一个受控的完整稿件基准测试,包含 1,260 个稿件版本,并评估了 30 个审稿人配置。该基准揭示了错误的鲁棒性,其中低重写敏感性与论文之间的分数崩溃同时发生,并表明人类对齐和修辞鲁棒性对审稿人的排名不同。此外,评估的以内容为中心的提示协议并不能持续提高跨主干网的鲁棒性。受这些发现的启发,我们引入了 SciCore,这是一个双分支审稿人,它将完整的手稿判断与基于提取的结构化科学核心的判断进行平均。这种设计将手稿级别的评估与内容标准化视图相结合,旨在降低修辞敏感性。在我们的主要 GPT-5.5 比较中,SciCore 在基准审核者中实现了领先的联合稳定性辨别能力,同时保持了具有竞争力的人类一致性。这些结果将修辞鲁棒性确定为一个独特的评估目标,并证明了科学核心审查改善修辞鲁棒性的潜力。