论文

方法是否支持这些主张?同行评审的论文内验证

Do Methods Support the Claims? Intra-Paper Verification for Peer Review

模型评测评测方法与指标

摘要

科学提交量的不断增长激发了人们对使用 大语言模型 (LLM) 协助同行评审的兴趣。现有的自动新颖性评估方法通常将论文声称的贡献与先前的文献进行比较,隐含地假设这些贡献在工作本身中准确实现。然而,人类审稿人经常质疑新颖性主张,并不是因为类似的想法已经存在,而是因为论文中提出的方法论证据没有充分支持它们。当前基于 LLM 的审查系统很少检查所声称的贡献和方法实现之间的内部不匹配。为了解决这一差距,我们引入了论文内声明验证,这是一个框架,用于评估论文中阐述的新颖性声明是否通过用于实现它们的方法得到证实。该框架采用 LLM 从引言中提取新颖性声明,检索与声明相关的方法论证据,并评估这些方法是否证实了所述贡献。评估以审稿人启发的评估标准为指导,该标准是从 182 篇 ICLR 2025 论文中收集的人类同行评审中归纳得出的。这些标准捕捉了审稿人反复关注的与新颖性、方法论、清晰度和其他问题相关的问题,并用于生成结构化的审稿人风格的声明证实评估。我们通过将 LLM 生成的审稿意见与人类审稿人对接受和拒绝论文的平衡子集的关注进行比较来评估该框架。人工评估表明框架生成的评估与人工审阅者的关注点之间存在显着的一致性,特别是对于新颖性相关的问题。 BERTScore 进一步将相应的人类 LLM 评论对与不匹配的对照区分开来,表明该框架捕获了与人类评论者观察结果一致的问题。