论文

FactReview:基于文献定位和基于执行的声明验证的循证评论

FactReview: Evidence-Grounded Reviews with Literature Positioning and Execution-Based Claim Verification

应用与实践科学研究

摘要

由于提交量不断增加和审稿人时间有限,机器学习领域的同行评审面临着越来越大的压力。大多数基于大语言模型的评审系统只阅读稿件并根据论文本身的叙述生成评论。这使得他们的输出对演示质量很敏感,并且当审查所需的证据存在于相关工作或已发布的代码中时,他们会变得很弱。我们推出了 FactReview,这是一种基于证据的审查系统,结合了主张提取、文献定位和基于执行的主张验证。对于提交的内容,FactReview 会识别主要主张和报告的结果,检索附近的工作以阐明论文的技术立场,并且当代码可用时,在有限的预算下执行已发布的存储库以测试中心实证主张。然后,它会生成一份简明的评论和一份证据报告,为每个主要主张分配五个标签之一:支持、论文支持、部分支持、冲突或不确定。在 CompGCN 的案例研究中,FactReview 再现的结果与链接预测和节点分类报告的结果非常匹配,但也表明该论文跨任务的更广泛性能主张并未完全得到支持:在 MUTAG 图分类上,再现的结果为 88.4%,而论文中报告的最强基线仍然为 92.6%。因此,该主张仅得到部分支持。更广泛地说,这个案例表明,人工智能在同行评审中最有用的不是作为最终决策者,而是作为收集证据和帮助评审者进行更多基于证据的评估的工具。该代码在 https://github.com/DEFENSE-SEU/Review-Assistant 上公开。

FactReview:基于文献定位和基于执行的声明验证的循证评论
图 1:FactReview 概述。该系统解析提交的内容,提取主要主张和报告的结果,将论文与附近的文献相对定位,并且当代码可用时,执行链接的存储库以验证中心经验主张,然后编写简明的评论和链接的证据报告。