论文
NovGauge:论文新颖性判断能力的细粒度诊断基准
NovGauge: A Fine-Grained Benchmark for Diagnosing LLMs' Capability in Paper Novelty Assessment
摘要
大型语言模型(LLM)越来越多地用于主要人工智能会议的同行评审中,但新颖性仍然是一个持续存在的弱点。现有的基准将新颖性作为单一的整体评分进行评估,这使得很难诊断模型误判了哪个维度或其证据是否可信。我们推出 NovGauge,一种以人为本的细粒度新颖性评估诊断基准。该基准包含 619 个论文对和 50 个多论文集,来自两个专家来源:ICLR 审稿人重叠声明和调查共被引。实例沿着三个维度独立标记:任务、问题和方法,捕获应用目标、技术挑战和解决方法。我们提出了一个级联诊断管道,用于验证每个维度的正确性、证据基础和逻辑支持。对 18 名大语言模型的评估显示,各个维度的幻觉率从 0% 到 39% 不等,在非幻觉的正确肯定判断中,超过 70% 的引用证据未能在逻辑上支持所述原因。表现最好的模型 GPT-5.5 在各个维度上实现了 43-72% 的已验证 F1,而大多数模型在忠实度验证后保留了不到一半的原始 F1。这些结果表明,目前的大语言模型距离可靠的科学新颖性评估还很远,特别是当正确性以忠实的证据为条件时。