论文
旧观念,新问题:基于LLM的新颖性评估的不稳定性
Old Ideas, Novel Problems: The Instability of LLM-Based Novelty Evaluation
摘要
自动构思系统通常根据其产生的想法的新颖性进行评估,并且这种判断越来越多地委托给大语言模型。这些评委通常是临时建立的,并且如果有的话,也是根据人类撰写的论文而不是根据他们要评分的生成的想法进行验证的。那么,新奇评委的表现如何呢?不太好。我们提出了新颖性评估设计选择的系统对照研究。我们首先自动构建一个评估集,在 OpenReview 中挖掘审稿人明确肯定或质疑论文原创性的段落,并仅保留在其研究领域的极端情况下一致同意的提交内容;我们将这些与普通大语言模型生成器的想法结合起来。在六名评委中,我们发现小的提示设计选择会产生很大的后果;例如,简单地告诉评审,审稿人发现一个想法新颖,而另一个想法不新颖,就可以改变其对所显示的一半以上相同想法对的判断,将成对的准确性改变超过 50 个点,有时会将其推至低于机会的水平。同样的变化有利于一位评审,也伤害了另一位评审。检索和更大的推理预算帮助不大,两个专门构建的新颖性评估器的表现优于我们最便宜的提示基线。这些结果对所报告的自动构思系统的新颖性收益提出了疑问,并需要强大的新颖性评估方法。