论文

DARE:扩散 大语言模型 对准和加固执行器

DARE: Diffusion Large Language Models Alignment and Reinforcement Executor

AI 基础设施AI 开发与运维平台

摘要

扩散 大语言模型 (dLLM) 正在成为主流自回归模型的一个引人注目的替代方案,用迭代去噪和并行生成动态取代严格顺序的词元生成。然而,他们的开源生态系统在模型系列中仍然是支离破碎的,特别是在 后训练 管道中,强化学习目标、轨迹采样实现和评估脚本通常作为特定于论文的代码库发布。这种碎片化减慢了研究迭代速度,增加了再现的工程负担,并使算法之间的公平比较变得困难。我们提出 \textbf{DARE} (\textbf{d}LLM \textbf{A}lignment 和 \textbf{R}einforcement \textbf{E}xecutor),这是一个用于 后训练 和评估 dLLM 的开放框架。 DARE 建立在 verl~\cite{sheng2024hybridflow} 和 OpenCompass~\cite{2023opencompass} 之上,在共享执行堆栈下统一了受监督的 微调、参数高效的 微调、偏好优化和 dLLM 特定的强化学习,适用于掩码和块扩散语言模型。在包括 LLaDA、Dream、SDAR 和 LLaDA2.x 在内的代表性模型系列中,DARE 提供了广泛的算法覆盖范围、可重复的基准评估和实际加速。广泛的实证结果表明,DARE 可作为可重复使用的研究基础,用于为当前和新兴的 dLLM 开发、比较和部署 后训练 方法。