论文
打破静态评估下审稿可靠性的幻象:针对大语言模型科学审稿人的范围模糊测试
Breaking the Illusion of Review Reliability under Static Evaluation: SCOPE Fuzzing for LLM-based Scientific Reviewers
摘要
投稿量和评审工作量的快速增长加速了大语言模型(LLM)在同行评审中的使用。先前的研究表明,大语言模型审稿人可以对内容扰动进行惩罚,例如夸大其词,表明一定程度的可靠性。然而,这些结论很大程度上基于用静态模板实例化的一组狭窄的扰动策略,提供了有限的实际可靠性证据。在本文中,我们构建了一个三层次的评估框架,涵盖表面呈现、论证逻辑和价值判断的扰动。对具有代表性的大语言模型审稿人进行的实验揭示了静态评估的两个局限性:分层漏洞(扰动效应取决于论文原始审稿分数的高低)和扰动覆盖不足(单个模板错过了不同实现所暴露的漏洞)。为了解决这些限制,我们提出了 SCOPE-Fuzzer,这是一种策略感知的模糊器,它将反馈驱动的策略选择与论文内容的自适应突变相结合。通过用动态扰动迭代地探测审核者,SCOPE-Fuzzer 不断发现静态评估和其他基线所忽视的漏洞。