论文

PeerPrism:同行评估专业知识与撰写评论的人工智能

PeerPrism: Peer Evaluation Expertise vs Review-writing AI

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用于科学同行评审,协助起草、重写、扩展和细化。然而,现有的同行评审 LLM 检测方法在很大程度上将作者身份视为人类与人工智能的二元问题,而没有考虑到现代评审工作流程的混合性质。在实践中,评估想法和表面实现可能来自不同的来源,从而创造了一系列人类与人工智能的协作。在这项工作中,我们介绍了 PeerPrism,这是一个由 20,690 条同行评审组成的大规模基准,明确旨在区分思想来源和文本来源。我们构建了涵盖完全人类、完全合成和多重混合转化的受控生成机制。这种设计能够系统地评估检测器是否识别表面文本的起源或评估推理的起源。我们在 PeerPrism 上对最先进的 LLM 文本检测方法进行基准测试。虽然几种方法在标准二元任务(人类与完全合成)上实现了高精度,但它们的预测在混合机制下却存在很大差异。特别是,当想法源自人类但表面文本是人工智能生成时,检测器经常会产生分歧并产生矛盾的分类。伴随着文体测量和语义分析,我们的结果表明,当前的检测方法将表面实现与智力贡献混为一谈。总的来说,我们证明同行评审中的 LLM 检测不能简化为二元归因问题。相反,作者身份必须被建模为跨越语义推理和风格实现的多维结构。 PeerPrism 是第一个评估这些环境中人类与人工智能协作的基准。我们在 https://github.com/Reviewerly-Inc/PeerPrism 上发布了所有代码、数据、提示和评估脚本,以促进可重复的研究。