论文

衡量人类与LLM研究理念之间的差距

Measuring the Gap Between Human and LLM Research Ideas

模型评测评测方法与指标

摘要

LLM 越来越多地用于集思广益研究想法,但现有的评估大多通过新颖性、可行性或专家偏好来判断个人想法。相反,我们会问:当前 LLM 产生的想法与人类研究人员的差距有多远?为了描述这一差距,我们根据高质量的人类研究论文构建了一个大规模的构思评估框架。对于每篇论文,我们都会对一小部分密切相关的先前作品进行逆向工程,这些作品可能激发了其核心思想。然后提示 LLM 从一组论文标题和摘要中生成一个新想法。我们引入了一个两轴研究品味分类法,通过机会模式和研究范式来描述每个想法,并用它来量化人类和 LLM 想法之间的差异。在不同 LLM 产生的想法集中,我们观察到一致的分布差距:LLM 想法不成比例地集中在类似桥梁的机会和综合方法上,而人类论文参考分布在框架差距和构建贡献的方式上更广泛地传播。这一结果表明,强大的 LLM 可以产生一系列合理的想法,但该范围仍然比人类研究品味更窄,并且相对于人类研究品味有系统地转移。