论文
微调大语言模型的翻译:一般性遗忘缓解不会保留机器翻译特定指令的遵循
Fine-Tuning LLMs for Translation: General Forgetting Mitigation Does Not Preserve MT-Specific Instruction Following
摘要
在并行数据上微调大型语言模型可以提高翻译质量,但可能会导致灾难性的遗忘。缓解方法通常通过保留一般基准来评估。我们询问这些发现是否会转移到机器翻译 (MT) 微调和 MT 特定指令遵循 (MT-IF):修改翻译的指令,例如形式、语法性别和长度控制。我们比较锚定到辅助数据、模型输出和基本模型参数的方法,首先使用 Llama 3.2 1B Instruct 进行筛选研究,然后在 Llama 3.1 8B Instruct 上对双向阿拉伯语-英语或西班牙语-英语数据进行微调。弹性权重合并在两个阶段都能最好地保留一般能力;在 8B 西班牙语模型上,一般基准的平均得分比标准微调的 11.0 下降了 1.7 分,但其形式和语法性别控制的得分仍然接近标准微调。只有与控制任务示例混合的数据才能保留这些控制,但其收益不会转移到同一任务的看不见的提示中。