论文

辩论即奖励:经由RL后训练实现科学创意构思的多智能体奖励系统

Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training

模型训练强化学习奖励建模与过程监督Agentic RL

摘要

大语言模型(LLM)在自动化科学创意构思上展现出潜力,但当前依赖迭代提示或复杂多智能体架构的方法常受困于幻觉或计算低效。将强化学习(RL)应用于这一开放领域的关键瓶颈是奖励劫持(reward hacking)——模型利用不完善的评估代理指标刷分,却不产生真正的科学创新。为克服这些局限,我们提出一个专为高质量科学创意生成设计的RL框架。我们提出首个充当裁判的多智能体奖励函数,将方法论验证与实现细节解耦,并给出对奖励劫持稳健的严格二元奖励。为针对这一稀疏信号进行有效优化,我们采用Group Relative Policy Optimization的无偏变体,以缓解人为的长度偏差。我们的训练基于ICLR-320,一个从ICLR 2024论文集中抽取的、经整理的问题-解答对数据集。实验表明,在专家评估的新颖性、可行性与有效性指标上,我们的框架显著优于最先进基线。

辩论即奖励:经由RL后训练实现科学创意构思的多智能体奖励系统:论文配图
图1:通过强化学习(RL)后训练内化科学推理的框架。流程包含五个阶段:(1)数据集整理,从ICLR 2024录用论文中提取研究问题和摘要,形成ICLR-320数据集;(2)候选生成,利用Qwen2.5 14B策略模型提出研究想法;(3)多智能体评审,以两名分析智能体和一名评估智能体进行辩论,分配二元奖励;(4)策略优化,使用Dr. GRPO(Group Relative Policy Optimization)更新模型,不进行标准差缩放;(5)最终评估,结合LLM-as-a-Judge与人类专家评审,评估训练后模型的新颖性、可行性和有效性。