论文

词元级 离策略 分配转变下的忠实一代学习

Token-Level Off-Policy Learning for Faithful Generation Under Distribution Shift

模型训练偏好优化

摘要

我们提出了 词元级 离策略 标签(TOPL),这是一种 离策略 训练范例,它将 后训练 重新构建为 词元级 正确性预测任务。我们的主要直觉是,通过训练模型来区分响应中的好标记和坏标记,我们自然会引导模型生成好标记,同时避免直接训练模型生成 离策略 标记所带来的陷阱。文档摘要任务的实验表明,TOPL 在 11 个数据集上针对不同的序列级和 词元级 基线集实现了强大的分布外泛化。我们进一步证明 TOPL 可以有效地转移到机器翻译,这表明它的好处可以推广到不同的忠实生成任务。通过消融研究,我们确认 词元级 学习信号对于良好的表现至关重要;序列级类似物不会带来类似的好处。最后,我们展示了 TOPL 引发可解释的模型更新:通过 TOPL 学习的 LoRA 适配器充当线性分类头和转向向量。