论文

CROP:通过选择性 同策略 蒸馏 的反事实确定任务相关性

CROP: Task Relevance via Counterfactuals for Selective On-Policy Distillation

摘要

同策略 蒸馏 (OPD) 在从当前策略中采样的轨迹上监督学生语言模型,但为具有不同监督值的响应词元分配相同的信用。选择性 OPD 通过根据估计的训练值在响应词元之间非均匀地分配监督来解决此限制。然而,大多数现有标准主要关注优化需求,例如不确定性或师生分歧,而任务相关性,即监督是否与当前输入的语义内容相关,仍然不太直接表征为补充维度。为了解决这一差距,我们引入了 同策略 蒸馏 (CROP) 的反事实相关性,它通过释义校准的反事实敏感度裕度来操作任务相关性。对于每个源提示,CROP 构建一个经过验证的原始释义反事实三元组,保持学生的滚动固定,并通过其对任务相关条件变化的敏感性来测量每个响应位置,并通过其对保留意义重写的敏感性进行校准。匹配选择控制表明,CROP 识别出比随机或最低相关性选择更有用的监督位置,而成分比较则证实了反事实敏感性和释义校准的价值。在两个师生设置中,CROP 比最强的非 CROP 选择器将总体性能提高了 1.92 和 2.96 个点。这些结果支持任务相关性作为选择性 OPD 的补充标准,并将 CROP 建立为模型内部、对比特定的方法来分配 词元级 监督。