论文

EvoIdeator:通过清单锚定强化学习实现科学构想的进化

EvoIdeator: Evolving Scientific Ideas through Checklist-Grounded Reinforcement Learning

模型训练强化学习

摘要

科学构想生成是自主知识发现的基石,然而将初始概念迭代演化为高质量研究提案,对大语言模型(LLM)而言仍是一项艰巨挑战。现有的强化学习(RL)范式通常依赖基于量规(rubric)的标量奖励,只能提供全局质量分数,缺乏可操作的细粒度。相反,基于语言的改进方法通常局限于推理时提示,其面向的模型并未经过显式优化以内化此类批评。为弥合这一空白,我们提出EvoIdeator,一个通过将RL训练目标与清单锚定(checklist-grounded)反馈对齐来促进科学构想进化的框架。EvoIdeator利用一个结构化评审模型生成两个协同信号:(1) 用于多维优化的字典序奖励(lexicographic rewards),以及(2) 提供关于论据支撑、可行性与方法严谨性的片段级批评的细粒度语言反馈。通过将这些信号融入RL循环,我们使策略条件化地在优化与推理两个阶段都系统性地利用精确反馈。大量实验表明,基于Qwen3-4B构建的EvoIdeator在关键科学指标上显著优于规模大得多的前沿模型。至关重要的是,所学策略无需进一步微调即可对多样化的外部反馈来源表现出强泛化,为自我精炼的自主构想生成提供了一条可扩展且严谨的路径。

EvoIdeator:通过清单锚定强化学习实现科学构想的进化:论文配图
Figure 1: Overview of EvoIdeator.给定一个研究查询和相关文献综述,EvoIdeator 策略会生成一个初始候选想法。然后,由基于清单的法官评估该想法,该法官会产生两个互补的信号:多维优化的词典奖励和指定应如何修改该想法的可操作的语言反馈。语言反馈与当前的想法一起被输入到政策修订模块中以产生改进的想法。同时,字典奖励用于 RL 循环中来更新 EvoIdeator 策略,从而使训练时间优化与推理时间细化保持一致。