论文
PaperDoctor:为正在进行的科学论文提供基于证据和可操作的反馈
PaperDoctor: Evidence-Grounded and Actionable Feedback for Scientific Papers in Progress
摘要
自动研究机构正在重塑研究生态系统,但他们也可能让有缺陷的主张大规模进入文献。人类顾问通过仔细、可追踪的反馈来发现草稿中的此类问题,但顾问式评估需要大量的手动工作并且无法扩展。为了将自动论文评估从法官转变为诊断专家,我们引入了 PaperDoctor,这是一个用于提交前反馈的代理框架,具有三项关键创新。首先,一个整体的分层框架通过三个层评估写作、布局、参考文献、代码、理论、先前的工作和实验:L1 表面筛选、L2 类型验证器(将每个声明路由到适当的证据)以及 L3 复制器(按优先级重新运行实验)。其次,每个发现都包含一个观察结果、指向特定证据(例如句子、方程或代码行)的指针以及修订建议,使批评可审计且可操作。第三,PaperDoctor 根据声明重要性和计算预算有选择地重建和重新运行实验,揭示仅从手稿中看不到的可重复性差距和定量限制。我们对 PaperDoctor 进行了评估,评估了 30 篇正在进行的论文,得出了 70.6% 的一致性和所有积极的整体分数,还评估了机器学习、自然科学和社会科学领域的 40 篇手稿,涵盖人类和人工智能撰写的带有代码的论文。总体而言,PaperDoctor 比人类和其他代理审阅者产生更多可审核的反馈,通过设计将批评与具体建议结合起来,并补充了人类审阅者经常忽视的维度。我们还开发了一个交互式界面,让作者可以浏览基于其论文的发现。 PaperDoctor 将自动论文评估重新定义为诊断而不是判决,为 AI 顾问实现更严格的 AI 辅助科学发现迈出了具体的一步。