论文

和而不同:大型推理模型的多领域对比策略优化

Harmony in Diversity: Multi-domain Contrastive Policy Optimization for Large Reasoning Models

模型训练强化学习

摘要

后训练 通过强化学习 (RL) 使大型推理模型 (LRM) 在各个领域实现强大的性能。然而,现实世界的应用程序越来越需要通用推理机在不同领域提供强大的性能。混合域后训练旨在通过混合域数据联合训练来实现这一目标,但这往往会导致不同域之间的能力妥协和退化。现有方法将这种性能下降归因于有害的跨域交互,并提出了各种策略来缓解它们,但这些策略也可能阻碍跨域的有益知识共享,进而无法匹配或超越单域性能。为了解决这个问题,我们提出 \textbf{M}ulti-domain \textbf{C}contrastive \textbf{P}olicy \textbf{O}ptimization (MCPO),它使用对比学习来利用积极和消极的跨域交互来进行知识共享和竞争。具体来说,我们根据 LRM 生成的每个 rollout 的底层推理结构进行分区,并使用推理段来捕获这些结构。因此,我们将正负推理片段对制定为相互增强的示例,为知识共享提供支持和竞争信号。随后,我们设计了跨领域知识共享和领域内知识整合的互补对比目标,以跨领域的兼容性和每个领域内的可区分性为目标,形成和谐的推理空间。广泛领域的实验结果表明,MCPO 减轻了混合域训练引起的性能下降,并且在大多数情况下优于单域训练。