论文
DIAGPaper:通过多代理推理诊断科学论文中有效且具体的不足
DIAGPaper: Diagnosing Valid and Specific Weaknesses in Scientific Papers via Multi-Agent Reasoning
摘要
使用单代理或多代理LLM识别论文不足正受到越来越多的关注,但现有方法存在关键局限。许多多代理系统仅在表面层次模拟人类角色,忽略了引导专家从互补的智识维度评估论文的底层标准。此外,既有方法隐含假设所识别的不足是有效的,忽视了审稿人偏见、误解以及作者反驳(rebuttal)在验证评审质量中的关键作用。最后,多数系统输出未排序的不足列表,而非为用户优先呈现最具后果的问题。在这项工作中,我们提出DIAGPaper,一个通过三个紧密集成模块应对这些挑战的新型多代理框架。customizer模块模拟人类定义的评审标准,并实例化多个具有特定标准专长的审稿代理。rebuttal模块引入作者代理,与审稿代理进行结构化辩论,以验证并完善所提出的不足。prioritizer模块从大规模人类评审实践中学习,评估已验证不足的严重程度,并向用户呈现最严重的top-K项。在AAAR与ReviewCritique两个基准上的实验表明,DIAGPaper产出的不足更有效、更贴合论文本身,并以面向用户、按优先级排序的方式呈现,显著超越现有方法。
