论文

跳出置信度陷阱:扩散LLM数学推理的演化解码

Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs

模型推理推理搜索与路径规划

摘要

扩散大语言模型(dLLMs)作为一种与自回归大语言模型(LLMs)相比的有前景的替代方案,通过块级渐进解码实现了高效的生成。然而,它们强大的通用性能并不必然转化为可靠的数学推理,因为正确性取决于保留清晰的数值-符号推理轨迹。在这项工作中,我们分析了LLaDa 2.0的解码轨迹,并识别了一个重复的扩散信心陷阱:在逐步块解码过程中,局部令牌信心与全局推理正确性不一致。我们的分析揭示了两个代表性失败模式:敏感于采样的失败,其中正确路径存在但不稳定;一致性的失败,重复采样收敛到重复的高信心但错误的延续。受这一观察的启发,我们提出了进化解码(Evolutionary Decoding),这是一个无需训练的测试时间扩展框架,将扩散解码视为候选推理状态的进化过程。该框架结合了步进选择,这保留了有用的数值-符号信号并抑制了重复模式,与块级变异相结合,引入了结构化的替代方案以逃离错误的高信心盆地。在多个基准测试上的实验表明,进化解码优于基于信心的解码,导致更可靠的数学推理。

跳出置信度陷阱:扩散LLM数学推理的演化解码:论文配图
图1:LLaDA 2.0 中的扩散置信度陷阱。(a) 八次独立运行显示两类失败:采样一致的失败与采样敏感的失败。(b) Pass@8 仍受限于70.0%,表明仅靠重复采样无法解决所有失败。(c) 分块统计展示成功、采样一致失败和采样敏感失败各自不同的轨迹模式。(d) 一个典型的采样一致失败进一步展示从逐步解除掩码到高置信度重复的转变。灰色方框表示一步解除掩码的 token。