论文
PeerCheck:增强 LLM 生成的学术评论以达到人类水平的质量
PeerCheck: Enhancing LLM-Generated Academic Reviews Towards Human-Level Quality
摘要
随着学术提交量的增加,传统的同行评审流程难以跟上,引发了人们对质量和公平性的担忧。使用大语言模型(LLM)寻求帮助的趋势已经出现。在这项工作中,我们朝着提高 LLM 生成的评论的质量迈出了关键的一步。我们提出了 PeerCheck 框架,该框架调查 LLM 与人类评论的差异(RQ1),并探索提高 LLM 生成的评论质量(RQ2)的方法。我们首先分析了人类撰写的评论和各种 LLM 生成的评论,发现 LLM 和人类关注不同的术语,例如,LLM 优先考虑理论,而人类则强调方法论和实验。我们进一步采用思想链(CoT)等即时工程,并利用检索增强生成(RAG)来增强 LLM 生成的评论,使其达到人类水平的质量。我们发现 CoT 显着提高了 LLM 评论的质量,同时我们发现了一个意想不到的“RAG 悖论”,即使用 RAG 进行的实验对各种 LLM 产生了不同的结果,在某些情况下甚至降低了评论质量。我们对 LLM 生成的学术评论进行全面分析,说明了可能性和局限性,有助于建立更有效、更人性化的评论系统。我们的数据集可在 https://github.com/TrustAIRLab/PeerCheck 上获取。