论文
跳出置信度陷阱:扩散LLM数学推理的演化解码
Escaping Confidence Trap: Evolutionary Decoding for Mathematical Reasoning in Diffusion LLMs
摘要
扩散大语言模型(dLLMs)作为一种与自回归大语言模型(LLMs)相比的有前景的替代方案,通过块级渐进解码实现了高效的生成。然而,它们强大的通用性能并不必然转化为可靠的数学推理,因为正确性取决于保留清晰的数值-符号推理轨迹。在这项工作中,我们分析了LLaDa 2.0的解码轨迹,并识别了一个重复的扩散信心陷阱:在逐步块解码过程中,局部令牌信心与全局推理正确性不一致。我们的分析揭示了两个代表性失败模式:敏感于采样的失败,其中正确路径存在但不稳定;一致性的失败,重复采样收敛到重复的高信心但错误的延续。受这一观察的启发,我们提出了进化解码(Evolutionary Decoding),这是一个无需训练的测试时间扩展框架,将扩散解码视为候选推理状态的进化过程。该框架结合了步进选择,这保留了有用的数值-符号信号并抑制了重复模式,与块级变异相结合,引入了结构化的替代方案以逃离错误的高信心盆地。在多个基准测试上的实验表明,进化解码优于基于信心的解码,导致更可靠的数学推理。
