论文
NovBench:在学术论文新颖性评估中评估 大语言模型
NovBench: Evaluating Large Language Models on Academic Paper Novelty Assessment
摘要
新颖性是学术出版的核心要求,也是同行评审的核心焦点,但提交数量的不断增加给审稿人带来了越来越大的压力。虽然 大语言模型 (LLM),包括那些根据同行评审数据进行微调的模型,在生成评审意见方面表现出了希望,但缺乏专门的基准限制了对其评估研究新颖性的能力的系统评估。为了解决这一差距,我们引入了 NovBench,这是第一个大规模基准测试,旨在评估 LLM 生成新颖性评估以支持人类同行评审的能力。 NovBench 包含来自领先 NLP 会议的 1,684 篇论文评论对,包括从论文介绍中提取的新颖性描述和相应的专家撰写的新颖性评估。我们关注这两个来源,因为引言提供了新颖性声明的标准化和明确的阐述,而专家撰写的新颖性评估构成了人类判断的当前参考标准之一。此外,我们提出了一个四维评估框架(包括相关性、正确性、覆盖范围和清晰度)来评估 LLM 生成的新颖性评估的质量。在不同的提示策略下对通用和专门的 LLM 进行的广泛实验表明,当前模型对科学新颖性的理解有限,并且微调模型经常存在指令遵循缺陷。这些发现强调需要有针对性的 微调 策略来共同提高新颖性理解和指令依从性。