论文
Block-R1:重新思考块大小在扩散的多域强化学习中的作用 大语言模型
Block-R1: Rethinking the Role of Block Size in Multi-domain Reinforcement Learning for Diffusion Large Language Models
摘要
最近,强化学习(RL)在 后训练 中被广泛应用于扩散 大语言模型(dLLM),以通过分块半自回归生成来增强推理。因此,块大小已成为 dLLM 中的一个重要因素,因为它决定并行解码粒度并影响 RL 优化(例如 GRPO)期间的采样轨迹轨迹。本文没有研究块大小在推理过程中对各个域的影响,而是从域冲突的角度研究多域场景中 dLLM RL 后训练 的块大小。主要贡献是:(1) dLLM 多域 RL 中域块大小冲突的表述,这将在很大程度上影响基于 rollout 的 RL 方法的 后训练 有效性; (2)一个新颖的数据集Block-R1-41K是用每个样本的最佳改进训练块大小构建的,这也引起了块大小冲突分数来定量测量域冲突; (3) 一个新的基准,Block-R1,用于单域和跨域中 dLLM 的灵活 RL 后训练; (4) 一种简单而强大的跨域 后训练 方法,具有样本级最佳改进的训练块大小。 Block-R1 全面涵盖了对 13 个不同数据集、7 种最新 RL 算法和不同 dLLM 主干的广泛实验。该基准测试在 https://github.com/YanJiangJerry/Block-R1 上开源,数据集在 https://huggingface.co/datasets/YanJiangJerry/Block-R1-41K 上发布。