论文

通过 GRPO 生成机器翻译的对抗性文本

Generating Adversarial Texts for Machine Translation via GRPO

模型训练强化学习

摘要

随着机器翻译 (MT) 系统的不断改进,标准基准测试所提供的信息越来越少,无法暴露剩余的弱点。创建具有挑战性的测试集的传统方法依赖于昂贵的手动创建或管理,而自动化方法则难以生成具有必要的翻译难度和语言多样性的测试集。我们提出了一种可扩展的基于强化学习的方法,用于将现有的源文本重写为更难以翻译为机器翻译系统的实例。我们使用基于翻译难度的奖励信号以及语义相似性、语法性和近似长度保留的约束,通过组相对策略优化(GRPO)对 大语言模型 进行微调。在 WMT25 上,我们的方法将平均 COMET 翻译质量从 0.63 大幅降低到 0.48,同时保留语法性和可读性,而基本模型仍保持在 0.64。对未见过的 WMT19-WMT24 基准的评估证实,这种行为超出了训练数据范围,而人工评估进一步表明,重写大大降低了翻译质量,同时自然度略有下降,语法也只有很小的变化。我们发布代码以支持可重复性。