论文
EvoIdeator:通过清单锚定强化学习实现科学构想的进化
EvoIdeator: Evolving Scientific Ideas through Checklist-Grounded Reinforcement Learning
摘要
科学构想生成是自主知识发现的基石,然而将初始概念迭代演化为高质量研究提案,对大语言模型(LLM)而言仍是一项艰巨挑战。现有的强化学习(RL)范式通常依赖基于量规(rubric)的标量奖励,只能提供全局质量分数,缺乏可操作的细粒度。相反,基于语言的改进方法通常局限于推理时提示,其面向的模型并未经过显式优化以内化此类批评。为弥合这一空白,我们提出EvoIdeator,一个通过将RL训练目标与清单锚定(checklist-grounded)反馈对齐来促进科学构想进化的框架。EvoIdeator利用一个结构化评审模型生成两个协同信号:(1) 用于多维优化的字典序奖励(lexicographic rewards),以及(2) 提供关于论据支撑、可行性与方法严谨性的片段级批评的细粒度语言反馈。通过将这些信号融入RL循环,我们使策略条件化地在优化与推理两个阶段都系统性地利用精确反馈。大量实验表明,基于Qwen3-4B构建的EvoIdeator在关键科学指标上显著优于规模大得多的前沿模型。至关重要的是,所学策略无需进一步微调即可对多样化的外部反馈来源表现出强泛化,为自我精炼的自主构想生成提供了一条可扩展且严谨的路径。
