论文
学习使用语言模型预测面向未来的研究提案
Learning to Predict Future-Aligned Research Proposals with Language Models
摘要
大语言模型 (LLM) 越来越多地用于辅助研究构思,但评估 LLM 生成的研究提案的质量仍然很困难:新颖性和合理性很难自动衡量,大规模的人工评估成本高昂。我们通过将提案生成重新定义为时间切片的科学预测问题,提出了一种可验证的替代方案。给定一个研究问题和在截止时间之前可用的鼓舞人心的论文,该模型会生成一个结构化提案,并根据它是否预见到该时间之后发表的论文中出现的研究方向来进行评估。我们通过未来对齐分数(FAS)来实现这一目标,该分数是通过检索和基于 LLM 的语义评分针对保留的未来语料库计算得出的。为了训练模型,我们构建了一个时间一致的数据集,其中包含来自目标的 3,642 个实例中的 21,835 篇论文出现及其截止前引用,并综合了教授差距识别和灵感借用的推理轨迹。在 Llama-3.1 和 Qwen2.5 模型中,面向未来的调整改进了未对齐基线的未来对齐(总体 FAS 高达 +10.6%),领域专家人工评估证实了提案质量的提高。最后,我们通过使用代码代理实现两个模型生成的提案来展示实际影响,通过新的提示策略和对新颖模型合并方法的一致改进,在数学上获得了 4.17% 的准确度增益。我们的代码和数据可在 https://github.com/Arthur-Heng/future-aligned-proposals 上公开获取。