论文

Active-GRPO:分子优化的自适应模仿和自我改进推理

Active-GRPO: Adaptive Imitation and Self-Improving Reasoning for Molecular Optimization

模型训练强化学习

摘要

科学推理是 大语言模型 日益重要的能力,但提高训练此类推理的稳健性和效率仍然是一个关键的开放挑战。我们在基于指令的分子优化中研究这个问题,其中仅答案监督的 微调 (SFT) 崩溃了多步推理,而具有可验证奖励的强化学习 (RLVR) 则受到稀疏反馈的影响。参考引导的策略优化通过将策略更新锚定到数据集提供的参考来缓解这两种情况,但其有效性与参考质量紧密耦合:弱或未对齐的参考会带来性能上限。为了克服这个上限,我们提出了主动推理,这是一种范式,其中策略根据每个实例主动决定何时模仿参考,何时强化自己的发现,同时不断升级其模仿的内容。我们将此范式实例化为主动组相对策略优化(Active-GRPO),通过两种耦合机制实现:主动模仿强化和主动引用。前者在参考仍然优于策略自己的候选者时执行模仿学习,并在策略生成超越参考的分子时通过强化学习转向自我改进。后者不断升级参考本身,用迄今为止发现的最佳策略生成候选替换它,逐步提高模仿目标,并确保参考指导在整个训练过程中保持信息丰富,而不是限制性。在 TOMG-Bench MOLOPT 中,Active-GRPO 在匹配的三种子评估下将平均 SRxSim 从 GRPO 的 0.0959 和 RePO 的 0.1665 提高到 0.1773,在 LogP、MR 和 QED 方面具有统计上显着的增益。