论文
巨人:科学文献中的生成洞察力预期
GIANTS: Generative Insight Anticipation from Scientific Literature
摘要
科学突破往往来自于将先前的想法综合成新颖的贡献。虽然语言模型 (LM) 在科学发现方面显示出前景,但它们执行这种有针对性的、基于文献的综合的能力仍未得到充分探索。我们引入了洞察预期,这是一项生成任务,其中模型根据其基础父论文预测下游论文的核心洞察。为了评估这种能力,我们开发了 GiantsBench,这是一个包含 8 个科学领域 17000 个示例的基准,其中每个示例都由一组父论文与下游论文的核心见解组成。我们使用 LM 判断来评估模型,该判断对生成的见解和 真值 见解之间的相似性进行评分,并表明这些相似性评分与专家的评分相关。最后,我们提出了 GIANTS-4B,这是一种通过强化学习(RL)训练的 LM,使用这些相似性分数作为代理奖励来优化洞察预期。尽管其开源架构较小,但 GIANTS-4B 的性能优于专有基线,并可推广到未见过的领域,与 Gemini-3-pro 相比,相似度得分相对提高了 34%。人类评估进一步表明,GIANTS-4B 产生的见解比基本模型在概念上更加清晰。此外,SciJudge-30B(一种经过训练可根据可能的引用影响来比较研究摘要的第三方模型)预测,GIANTS-4B 生成的见解更有可能导致更高的引用,在 68% 的成对比较中,它们比基本模型更受青睐。我们发布代码、基准和模型来支持自动化科学发现的未来研究。