论文
通过强化学习激励参数知识,并为跨文化实体翻译提供可验证的奖励
Incentivizing Parametric Knowledge via Reinforcement Learning with Verifiable Rewards for Cross-Cultural Entity Translation
摘要
对于 大语言模型 (LLM) 来说,跨文化实体翻译仍然具有挑战性,因为通常会生成字面或语音翻译,而不是上下文中适合文化的翻译。然而,在大规模预训练期间,相关知识可能已经被编码在模型参数中。为了激励参数化知识的有效使用,我们提出了 EA-RLVR(具有可验证奖励的实体锚定强化学习),这是一种无需依赖外部知识库即可优化跨文化实体翻译的训练框架。 EA-RLVR 将监督锚定在可验证的实体级奖励信号上,并结合轻量级结构门来稳定优化。这种设计引导模型学习强大的推理过程,而不仅仅是模仿参考翻译。我们在 XC-Translate 上评估 EA-RLVR,并观察到实体翻译准确性和域外泛化方面的持续改进。具体来说,仅对 7k 个样本进行训练即可将 Qwen3-14B 在包含完全不可见实体的 50k 测试集上的实体翻译准确性从 23.66% 提高到 31.87%。学习到的实体翻译能力也转移到一般翻译,在 WMT24++ 上产生 +1.35 XCOMET,通过扩展优化可扩展到 +1.59。对 $pass@k$ 动态和奖励公式的广泛分析将这些收益归因于卓越的采样效率和稳定的优化环境。