论文

大语言模型 能否预测研究人员接下来的研究内容?

Can Large Language Models Forecast What Researchers Study Next?

模型评测基准与评测资源

摘要

大语言模型 越来越多地产生研究想法,但在产生时判断其新颖性或可行性并不能确定他们是否预期后续工作。我们引入 IdeaForecastBench 来评估研究想法预测。给定一个社区的文献达到截止值,系统会产生最多五个排名的想法,并根据后来的论文进行评估。该基准包括 52 个主题的 624 个滚动剧集,采用固定的检索然后判断协议,并由两名法官分别报告结果。我们比较了 GPT-4.1、Qwen2.5-7B/14B 和 Qwen3.5-9B 的五种历史压缩策略,以及学习的模式分解预测器 (MDF)。在主要的 GPT-4.1-mini 评审下,Summary 在所有四个骨干网的 Hit@5 和 Precision@5 中比 Direct 有所改进。 Qwen2.5 的得分高于 GPT-4.1,而 Qwen3.5 的得分低于 GPT-4.1。一项结果盲评估发现,Qwen2.5 产生了更广泛的预测,但没有确定有多少广度有助于其优势。阈值和判断诊断进一步澄清了将实现解释为精确预期的局限性。 IdeaForecastBench 提供了一项常见任务,用于研究社区随后追求哪些研究想法以及衡量该结果的可靠性。