SLIM-RL:用于扩散 LLM 的风险预算随机掩蔽 RL,无需轨迹切片
SLIM-RL: Risk-Budgeted Random-Masking RL for Diffusion LLMs Without Trajectory Slicing
摘要
扩散强化学习 大语言模型 (dLLM) 已在很大程度上转向轨迹感知方法。目前最先进的 TraceRL 认为随机掩蔽与模型的推理轨迹不匹配,并且它在训练期间通过将每条执行轨迹分割为最多 K/s 轨迹对齐的训练样本来重建该轨迹,成本随着块大小 K 的增加而增加。我们表明,可以在不重建轨迹的情况下减轻这种不匹配。我们的方法 SLIM-RL 使用 tau 预算解码器限制每个轨迹生成步骤的提交风险,从而降低训练数据中的总体提交风险。在优化过程中,SLIM-RL 使用无痕随机掩蔽目标对这些风险受控的采样轨迹进行训练,该目标采用方差减少工具,结合序列级重要性采样、在我们引入的均值保持、单调递减的每块掩码计划下对掩蔽级别进行确定性求积。在 SDAR-4B 上,SLIM-RL 在块大小 16 的训练样本上仅达到 TraceRL 的最佳 MATH500 精度的 0.46 倍,在匹配的动态采样下,在 MATH500 上比 TraceRL 提高了 6.32%,在 GSM8K 上提高了 11.05%。在块大小为 4 时,4B SLIM-RL 在数学上超过了较大的 LLaDA-8B 和 Dream-7B dLLM,在 MATH500 上超过了 LLaDA-8B 10.76%,同时保持低于自回归 Qwen2.5-7B。在代码上,它在 MBPP 上比 TraceRL 提高了 4.20%,在 HumanEval 上比 TraceRL 提高了 3.65%。 tau-budget 解码器在 LLaDA、Dream 和 SDAR 之间传输 无需训练。源代码可在 https://github.com/laolaorkkkkkk/SLIM-RL 获取。