论文
先思考,后扩散:以自回归规划条件化改进扩散语言模型推理
Think First, Diffuse Fast: Improving Diffusion Language Model Reasoning via Autoregressive Plan Conditioning
摘要
扩散大语言模型(dLLM)经迭代去噪生成文本,但在多步推理上持续落后。我们假设这一差距源于协调问题:自回归(AR)模型逐词元建立连贯性,而扩散模型必须同时协调所有位置。我们提出规划条件化(plan conditioning),一种免训练方法:把来自AR模型的简短(约100词元)自然语言规划前置到扩散模型的提示中。该规划充当冻结脚手架——从第一步去噪起每个词元位置都能注意到的全局可见语境。在GSM8K上,规划条件化把LLaDA-8B-Instruct从75.6%提升到87.2%(+11.6个百分点),追平同规模AR模型(LLaMA 3.1 8B,87.7%),尽管其基线弱6.4个百分点。在HumanEval上增益+12.8个百分点(37.2%到50.0%),表明规划可泛化到代码。同样的规划对LLaMA在GSM8K上仅+5.7个百分点、HumanEval上+1.3个百分点——扩散模型受益高2–10倍,支持协调问题假设。跨5个随机种子,规划条件化后的GSM8K准确率标准差为零,使扩散推理高度稳定。消融显示模型遵循规划策略(错误策略规划导致-16.3个百分点)但对规划中的数值鲁棒(扰动数字:-1.1个百分点),且规划器质量存在陡峭阈值:较小的Llama级规划有害(-1.6至-6.8个百分点),前沿规划才带来全部增益。注意力分析证实机制:规划词元在早期去噪中获得1.8倍超额注意力,随补全词元固化而降至均匀。规划条件化每题成本约0.002美元,增加约2秒延迟。
