论文

N-GRPO:嵌入级邻居混合以增强策略优化

N-GRPO: Embedding-Level Neighbor Mixing for Enhanced Policy Optimization

模型训练强化学习

摘要

大语言模型 在数学推理方面的成功在很大程度上依赖于在采样轨迹阶段生成多样化且有效的解决方案路径。然而,当前的采样轨迹技术面临着一个基本的权衡:词元级 采样通常会产生仅在改写方面有所不同的冗余轨迹,而利用随机噪声的嵌入级方法经常会破坏语义一致性。为了解决这个问题,我们引入了 N-GRPO,这是一种集成到组相对策略优化 (GRPO) 框架中的新颖探索策略。我们的方法不依赖 词元级 采样或本机嵌入级噪声,而是利用语义邻居混合。该机制通过混合锚标记及其最近的语义邻居的嵌入来动态构造输入表示,从而在严格遵守局部语义流形的同时注入多样性。对不同规模的 DeepSeek-R1-Distill-Qwen 模型的实验评估表明,N-GRPO 不仅在数学推理基准上实现了对强基线的一致改进,而且在分布外任务上表现出了强大的泛化能力。