论文
超越块边界:面向扩散大语言模型的多块编辑
Beyond Block Boundaries: Multi-Block Editing for Diffusion Large Language Models
摘要
块扩散(block diffusion)是扩展离散扩散语言模型(dLLM)的主流方法,因为固定大小的块在保持并行解码的同时使二次方注意力开销可控。然而分块生成带来了结构性弱点:靠近块边界的词元缺乏未来跨块上下文,而已定稿块中的错误会成为后续生成的不可逆上下文。我们将其称为块边界问题。对有无后继块上下文两种预测的测量表明,边界敏感度急剧上升:在AIME 2025上,块最后四分之一区间的平均自含性分歧(SCD)是前四分之一区间的61.3倍。我们提出多块编辑(Multi-Block Editing,MBE),利用跨块上下文修订已解码的词元。免训练MBE在选定块上重新打开全注意力窗口,无需参数更新。为解决块扩散训练与MBE推理之间的不匹配,多块编辑SFT引入双向注意力掩码并逐步扩大编辑跨度。我们还扩展了SGLang,加入多形状CUDA Graph池与细粒度KV缓存控制,以支持高效的变长编辑。在LLaDA2.1-Mini上跨12个基准的实验显示了广泛而一致的增益。免训练MBE在每个基准上都优于或持平于标准解码。完整MBE将12个基准的平均分从61.45提升至64.24,在AIME 2025上最高提升13.33分,同时在四个数据集上保留标准解码87.3%–96.7%的端到端吞吐量。
