论文
智能体评审系统基准测试
Benchmarking Agentic Review Systems
摘要
一类新的智能体评审系统正作为AI辅助研究给同行评审施压的补救措施涌现——但应如何评估它们尚不清楚。我们评估两个开源系统(OpenAIReview与coarse)、一个专有系统(Reviewer3)与一个零样本基线——跨横跨前沿与高效模型的六个LLM。第一——我们研究AI对ICLR/NeurIPS论文的评审是否与以引用与录用决定等外部信号近似的论文质量相关。每个系统的成对准确率都高于随机——最佳为OpenAIReview+GPT-5.5的83.0%。第二——为测试系统能否捕获有已知真值的错误——我们构造扰动基准——把四类错误注入横跨八个arXiv学科类的论文——并测量检出召回。最强配置(OpenAIReview+GPT-5.5)捕获71.6%的注入错误——留有巨大改进空间。跨六模型的检出并集达83.3%召回——提示不同模型检出不同错误——更好的测试架设计可能提升性能。除这些基准外——我们研究有真实用户的OpenAIReview公开部署。其评论上的投票以1.44比1偏正面——最常见抱怨是假阳性与琐碎挑剔。合起来——通过在真实研究论文上评估由SOTA模型支撑的完整评审系统——我们表明:虽然AI评审仍有改进空间——它们已能很好地追踪人类质量判断、捕获重要错误——并从真实用户赢得正面反馈。
