论文
多约束指令遵循的反事实约束条件同策略蒸馏
Counterfactual Constraint-Conditioned On-Policy Distillation for Multi-Constraint Instruction Following
摘要
多约束指令跟踪要求模型能够在许多同时活动的约束下响应查询。即使是强大的指令调整模型仍然经常违反其中的一些规则。现有的方法要么通过来自外部验证者或学习评分者的序列级或词元级强化学习奖励来增强监督,要么对单个全上下文教师使用策略蒸馏(OPD),随着更多约束同时激活,其概率质量会被稀释。我们提出了 CC-OPD(反事实约束条件的策略蒸馏),它反转了蒸馏中的标准监督生成方向。 CC-OPD 不是向教师提供超出学生所见的信息,而是依次消除教师调节中的每个约束,并根据生成的每个标记的概率差异构建每个约束信号。由此产生的每个词元的留一对数似然变化会被求和、剪裁,并作为词元级别的塑造项添加到普通 OPD 奖励中。所有的整形项都是从冻结的教师那里获得的,在蒸馏过程中没有外部验证者,并且只要总位移为零,奖励就等于普通的 OPD。在两个 Qwen 模型对和七个基准测试中,CC-OPD 在所有评估的学生训练方法中取得了最高的平均值。在 MulDimIF 基准上,接受 CC-OPD 训练的 1.5B 学生超过了自己的 7B RL 训练教师。