论文
DPRM:用于离散扩散模型的插件 Doob h 变换诱导的词元排序模块
DPRM: A Plug-in Doob h transform-induced Token-Ordering Module for Discrete Diffusion Models
摘要
离散扩散模型承认许多词元顺序,但大多数系统依赖于基于置信度的解码。信心是一种强大而有效的启发式方法,但它可能是短视的,因为局部确定性并不能衡量仓位对终端质量的影响。我们引入了 DPRM(Doob h 变换过程奖励模型),这是一个由终端奖励倾斜轨迹分布引起的插件词元排序模块。 Doob 变换将每个候选位置的最终奖励转换为过程奖励。由生成进度、置信度和可选位置或任务状态索引的紧凑估计器使得该校正可在部分状态中重复使用。 DPRM 仅更改词元顺序;主机架构、去噪目标、监督和词元采样器保持固定。我们推导出精确的奖励倾斜法则并限制其候选名单和在线近似值。在跨越语言、多模态生成和科学序列的九个最新开源主机中,DPRM 改进了推理、数字 VQA、视觉码本排序和偏好条件生成。相对于置信度,PUMA GSM8K 提高了 14.6%,Omni-Diffusion CLIP-L/14 提高了 13.2%,Prism 投票准确度从 82.41% 提高到 83.85%,RealWorldQA 数字/计数准确度提高 8.97 点。匹配的科学收益包括 DCM 非零回收率 8.3%、GenMol QED 15.0% 和 SDPO-DNA 总效用 53.3%。熵和随机顺序控制表明,收益并不是来自不加区别地偏爱不确定的词元。相反,词元顺序跟踪和共享状态干预显示了终端奖励如何纠正局部自信但全局较差的选择。代码位于:https://github.com/DakeBU/DPRM-DLLM。