论文

通过上下文选择和目标加权微调扩散语言模型

Fine-Tuning Diffusion Language Models with Context Selection and Target Weighting

模型训练监督微调与指令调优

摘要

离散扩散语言模型的监督微调掩盖了一些响应标记,并训练模型从可见上下文中恢复其原始值。因此,掩码模式决定了模型可用的上下文和它学习预测的标记。均匀随机掩蔽并没有明确解释这些选择之间的相互作用。我们引入 GoldiMask,它通过近似最大化子模块目标来选择标记作为上下文来显示。该目标使用模型信号来平衡揭示词元的好处与其作为预测目标的价值。然后,GoldiMask 根据剩余目标如何从所选环境中受益以及剩余学习潜力对剩余目标进行加权。在三个主干网和三个训练数据集上,GoldiMask 在大多数评估设置中实现了最高的平均准确度,展示了推理和代码生成方面的收益。成分消融表明,上下文选择和目标权重都有助于增益。 GoldiMask 还减少了置信阈值并行解码下 GSM8K 和 MATH-500 上的解码迭代,同时在较高置信阈值下保持相当的精度。