论文

更好的文学翻译:多方面数据生成和 LLM 训练方法

Better Literary Translation: A Multi-Aspect Data Generation and LLM Training Approach

模型训练合成数据

摘要

由于高质量注释数据的稀缺以及需要平衡表达流畅性和文学效果,文学翻译面临着独特的挑战。我们提出了一个多方面迭代细化框架,通过专门的 LLM 翻译器生成高质量的翻译参考和偏好数据,每个翻译器都针对不同的质量维度。我们利用生成的数据进行监督 微调 和强化学习。实验表明,我们生成的参考在 SFT 方面优于原始 真值 8.65 个 CEA100 点。对于强化学习,我们发现 DPO 会导致这种设置下的性能下降,而利用 GRPO 的显式奖励模型可额外提高 1.51 分。我们将此归因于两阶段训练的稳定性和GRPO的在线探索能力。我们得到的模型 LitMT-8B 和 LitMT-14B 在 MetaphorTrans 英汉文学翻译基准上分别达到 67.25 和 69.07 CEA100,与 Claude Sonnet 4.5 的 68.43 竞争,并且表现出对域外文学作品(即欧·亨利)的强大泛化能力。