论文

LogicDiff:逻辑引导去噪改进了掩蔽扩散语言模型中的零样本推理

LogicDiff: Logic-Guided Denoising Improves Zero-Shot Reasoning in Masked Diffusion Language Models

模型推理解码与生成控制

摘要

屏蔽扩散语言模型 (MDLM) 通过从完全屏蔽的序列中迭代地揭开标记来生成文本。他们的标准基于置信度的揭露策略系统地推迟了高熵逻辑连接标记,从而降低了推理性能。我们引入了 LogicDiff,这是一种推理时间方法,用逻辑角色引导的揭露取代了基于置信度的揭露。轻量级分类头(420 万个参数,基本模型的 0.05%)从基本模型的隐藏状态预测每个屏蔽位置(前提、连接、导出步骤、结论或填充符)的逻辑角色,准确率高达 98.4%,并且依赖顺序调度程序按逻辑顺序揭开标记。在零样本设置中,LogicDiff 将 GSM8K 上的 LLaDA-8B-Instruct 准确率从 22.0% 提高到 60.7%(+38.7 个百分点),将 MATH-500 上的准确率从 23.6% 提高到 29.2%(+5.6 个百分点),速度开销不到 6%。然而,在 8 次思维链提示的情况下,基线达到大约 70%,并且 LogicDiff 没有提供额外的改进。分析表明,few-shot 提示隐式地解决了 LogicDiff 显式解决的相同排序问题,并且基于角色的固定排序可能会导致在足够的上下文可用之前过早地承诺数值。我们的结果将灵活性陷阱描述为主要是一种零样本现象,并将上下文自适应排序确定为未来工作的关键方向。