论文
扩散语言模型中的就地指令遵循
In-Place Instruction Following in Diffusion Language Models
摘要
Diffusion 大语言模型 (dLLM) 通过双向迭代去噪生成文本,自然支持锚定在任意输出位置的用户指定的约束,这种范例称为就地提示 (IPP)。我们将其形式化为就地指令跟踪 (IIF) 任务,并构建 IIF-Bench,这是一个跨越文字、风格和话语功能约束的分层基准,并与基于标题的局部全局评估协议配对。推理时间注意力偏差探测表明,普通 dLLM 在去噪过程中常常低估约束跨度。然后,我们提出了 GRAFT,一种面向 IPP 的 后训练 框架,结合了约束感知 SFT 和偏好优化。在四个代表性的 dLLM 中,Graft 将平均 IIF 分数从 57.75 提高到 73.10(+15.35 分),在文字和话语功能约束上的绝对增益分别为 15.91 和 15.57 分,同时保留一般生成能力。