论文

当指标奖励最差的翻译时:内化社交媒体翻译评估的文化推理

When Metrics Reward the Worst Translations: Internalizing Cultural Reasoning for Social Media Translation Evaluation

模型训练强化学习

摘要

在通用领域语料库上训练的自动翻译质量指标在社交媒体内容上系统性地失败了,其中交流意图被编码为文化负载的表达方式(互联网俚语、同音密码和特定于平台的习语),而不是表面标记模式。我们进行了系统的实证分析,证明包括 COMET、XCOMET 和 BERTScore 在内的标准指标与人类文化判断的相关性接近于零或呈负相关,甚至表现出严重性倒置,即随着翻译质量的恶化,分数增加。我们进一步表明,这种失败延伸到了 大语言模型 法官:Qwen3-235B 的科恩 kappa 仅为 0.162,这表明瓶颈不是推理能力,而是文化基础:模型缺乏识别翻译的哪些方面需要审查所需的特定领域文化知识。为了解决这个问题,我们提出了 CuRIL,一种内化文化推理的强化学习框架:文化注释被预先添加到模型的推理中,通过 词元级 损失掩码从策略梯度中排除,并注入在训练过程中衰减到零的概率,逐步强制自主文化判断。在 1,444 个样本的人工注释社交媒体翻译基准上,使用 CuRIL 训练的 Qwen3-8B 实现了 Cohen 的 kappa 0.370 和 45.22% 的精确匹配准确率,接近 Gemini-3.1-Pro,参数减少了 30 倍,并在规模上超越了高达 235B 的模型。我们进一步证明,我们的法官为下游翻译优化提供了可靠的奖励信号,在独立的人工评估下将低质量翻译率降低了 20 个百分点以上。