论文
Co-RL:无监督推理从多智能体 RL 的多样化队列中出现
Co-RL: Unsupervised Reasoning Emerges from Diverse Cohort in Multi-agent RL
摘要
强化学习 (RL) 已成为改善语言和视觉语言模型推理的强大方法,但其最大的成功仍然在很大程度上取决于 真值 监督(例如,可验证的奖励)。获得此类注释的成本很高,并且随着推理能力的发展超出了人类可靠评估的范围,此类注释变得越来越稀缺。自我奖励强化学习使模型能够从自己的完成情况中获取奖励信号,从而减少了这种依赖性。然而,仅根据自我生成的反馈进行训练可能会加剧现有的偏见和次优行为,减少响应多样性,并最终导致同质化响应和训练崩溃。在这项工作中,我们证明了可以通过协作多智能体训练来出现无监督推理。我们引入了 Co-RL,这是一个框架,其中多个解耦模型(不共享参数)通过 RL 使用来自同行的奖励同时进行优化。我们进一步表明,通过异构模型系列、大小和重新表述的训练样本来增加队列多样性,可以减少驱动自我强化反馈循环的相关错误。这种多样性持续提高推理性能,保持行为多样性,并减轻训练崩溃。在纯文本和多模态领域,Co-RL 始终优于基本模型和先前的无标签方法,同时匹配或超越监督方法,无需访问任何 真值 标签。具体而言,Co-RL 在 LLM 的 7 个纯文本基准中产生了 3.0-8.6% 的平均增益,在 VLM 的 4 个多模式基准中产生了 2.3-7.2% 的平均增益。代码可在 https://github.com/DrStranded/Co-RL 获取。