论文
辩论即奖励:经由RL后训练实现科学创意构思的多智能体奖励系统
Debate as Reward: A Multi-Agent Reward System for Scientific Ideation via RL Post-Training
摘要
大语言模型(LLM)在自动化科学创意构思上展现出潜力,但当前依赖迭代提示或复杂多智能体架构的方法常受困于幻觉或计算低效。将强化学习(RL)应用于这一开放领域的关键瓶颈是奖励劫持(reward hacking)——模型利用不完善的评估代理指标刷分,却不产生真正的科学创新。为克服这些局限,我们提出一个专为高质量科学创意生成设计的RL框架。我们提出首个充当裁判的多智能体奖励函数,将方法论验证与实现细节解耦,并给出对奖励劫持稳健的严格二元奖励。为针对这一稀疏信号进行有效优化,我们采用Group Relative Policy Optimization的无偏变体,以缓解人为的长度偏差。我们的训练基于ICLR-320,一个从ICLR 2024论文集中抽取的、经整理的问题-解答对数据集。实验表明,在专家评估的新颖性、可行性与有效性指标上,我们的框架显著优于最先进基线。
