论文
LLM Co-Evolution 中课程多样性的词汇丢失
Vocabulary Dropout for Curriculum Diversity in LLM Co-Evolution
摘要
共同进化的自我游戏,一种语言模型产生问题,另一种语言模型解决问题,有望在没有人类监督的情况下进行课程学习。这一承诺在实践中很早就破裂了。提议者收敛到满足奖励函数的问题的狭窄分布,而折叠的课程向解决者传授的知识很少,导致循环停滞。我们引入了词汇 dropout,这是一种轻量级干预,在政策训练和课程生成过程中随机掩盖提议者的输出 logits。掩码是硬性且非平稳的,因此提议者无法锁定固定的词元序列。通过 R-Zero 对 Qwen3-4B 和 Qwen3-8B 进行数学推理训练,词汇 dropout 在整个训练过程中在词汇、语义和功能测量方面保持了提议者的多样性,并将求解器在 8B 上平均提高了 +4.4 分,在竞赛级别基准上获得了最大的收益。明确的动作空间约束,填补了游戏规则在经典自我博弈中所扮演的结构角色,可以保持语言的共同进化。词汇丢失是强加它们的一种简单方法。