为什么确定性 PRM 指导在离散扩散推理中表现不佳
Why Deterministic PRM Guidance Underperforms in Discrete Diffusion Reasoning
摘要
离散扩散语言模型 (dLLM) 在每一步都公开一个降噪解决方案,这使得过程奖励模型 (PRM) 指导看起来像是一种在测试时花费计算的方式。我们表明,一旦将去噪、PRM 评分和结果奖励模型 (ORM) 评分纳入相同的前向传递预算中,其确定性形式就会变得更加简单。我们的 PRM 对中间去噪状态进行评分,并针对最终答案的正确性进行训练。在 Dream-v0-Instruct-7B 上,每个 GSM8K 问题有 8 个候选者,在每个评分步骤中保留具有最高 PRM 分数的候选者达到 65.18%,而独立采样加上针对该任务训练的 ORM 重新排序器达到 75.13%。 32 名候选人的差距扩大到 12.69 个百分点 (pp),其中 MATH 为 9.85 个百分点,MBPP 为 12.16 个百分点。我们将其追溯到两个可分离的故障。首先,指导对弱信号进行剪枝:在 GSM8K 上,随着掩码比的上升,PRM ROC-AUC 从 0.77 下降到 0.54,当用新的rollout重新标记状态时,这种衰减会持续存在,并且剪枝将候选池中可达到的最佳准确率从独立样本的 81.05% 降低到 67.30%。其次,在 GSM8K 和 MATH 上,PRM 的最终判断能力很差:相同预算下的连续蒙特卡洛采样器将上限恢复到 77.89%,但使用 PRM 进行选择则给出 65.48%,与确定性指导相当,而在最终状态上重新训练的 PRM 与相同候选对象上的 ORM 相匹配。 MBPP 将两者分开:对完成的程序重新排序时,PRM 达到 65.47%,与 ORM 相当,但当它指导去噪时,PRM 达到 50.88%。结果指出了 dLLM 指导的两个目标:通过早期去噪保持正确的部分解决方案,并将最终选择留给经过最终状态训练的验证者。我们发布了带有结果标签的去噪状态语料库和评估工具包,以便在匹配计算时进行可重复的比较。