四十度蓝色:通过模式条件强化学习实现质量多样性协调
Forty Shades of Blue: Quality-Diversity Alignment via Mode-Conditioned Reinforcement Learning
摘要
LLM 对齐训练的一个值得注意的副产品是模式崩溃:输出多样性的逐渐丧失,缩小了模型在推理时的表达能力。对于需要开放式探索和多元化视角的应用程序(例如科学构思和创意写作),这种降级尤其受到限制。我们提出了 MoDA(模式条件多样性对齐),这是一种在线训练后 RL 算法,受多智能体强化学习 (MARL) 协调视角的启发,可以联合优化生成质量和多样性。 MoDA 训练一个以抽象编号角色为条件的共享 LLM 策略,其中每个角色充当代理,竞争产生与其他角色不同的输出。这种公式鼓励模式调节代理探索高质量输出空间的互补区域,而不需要手工制作的角色或架构修改。 MoDA 采用即时自适应质量门控机制,可校准参考质量阈值,并仅向满足阈值的响应授予多样性奖励,从而防止损害响应质量的奖励黑客行为。为了研究质量与多样性的权衡,我们根据一套全面的基准对 MoDA 进行了评估,该基准涵盖科学构思和创意写作中的七个一般能力任务和四个特定领域的多样性任务。 MoDA 在 Infinite-Chat 保留提示上将 SBERT 多样性提高了 265%,同时将平均一般能力 pass@1 比 Qwen3-8B 基线提高了 10.3%。与最强的 DivPO 基线相比,MoDA 将 SBERT 多样性从 0.274 提高到 0.482 (+75.9%),将 E-Vendi 从 2.86 提高到 4.4 (+53.8%),同时将平均一般能力 pass@1 提高 7.0%。总体而言,MoDA 提供了标准训练后方法的直接替代方案,可以保留和扩展模型的表达输出空间,同时提高质量。