论文
StalePO:在机器翻译中使用传统后期编辑进行锚定标记级偏好优化
StalePO: Anchored Token-Level Preference Optimization using Legacy Post-Edits in Machine Translation
摘要
机器翻译系统会定期升级到更强大的模型,但可用的偏好信号是对旧系统输出的人工后期编辑,而新模型可能已经超越了旧系统的输出。此外,为每个新模型收集新的后期编辑成本高昂。我们称之为陈旧偏好问题。标准 DPO 在这种情况下可能会失败:它可能会增加后期编辑质量较差的可能性,损害模型的现有质量,并且无法提供纠正局部错误所需的每个词元控制。我们引入了 StalePO,这是一个源自该制度施加的三个要求的目标。两个响应的可能性运动必须向下,策略必须锚定到其自己的基本响应,并且 KL 约束必须应用于词元级别。这些要求是共同必要的。在消融中,每种单独的机制都使模型的性能与基本模型无法区分,只有它们的组合才能将过时的反馈转化为收益。在英语到印地语和英语到土耳其语的本地化数据上,StalePO 将通过所有 LLM 法官 MQM 质量检查的片段比例分别提高了 14.9 和 4.6 个百分点,收益主要集中在风格和流畅度上。同一框架下的人工评估证实了英语到印地语的这些进步,将通过所有七项人工检查的片段比例提高了 13.8 个百分点。