论文

超越“可能涉及的人”:根据受众和意图定制机器翻译

Beyond "To whom it may concern": Tailoring Machine Translation to Audience and Intent

模型评测模型能力评测

摘要

翻译质量取决于目的:相同的源文本需要不同的翻译,具体取决于受众、语气和交流意图。然而,机器翻译模型和指标将翻译视为从源到目标的固定映射。 LLM 使用户能够在源文本旁边明确指定目的,但此功能尚未大规模评估。我们引入了针对 50 种语言、5 种模型大小和 8 个文本域的目的驱动机器翻译的系统评估。我们发现(1)显式指令极大地提高了翻译适应性,对于更大的模型大小和更高资源的语言,在非正式领域(对话、社交媒体)有更大的收益; (2) 指令优于语义匹配的小样本示例和段落级上下文; (3) 传统的机器翻译指标无法捕捉改编质量,常常会影响改编翻译; (4) 当策划指令不可用时,模型可以从周围的文档上下文中自行生成它们,从而缩小策划指令的 80% 的适应性差距。我们的结果表明,适应用途的机器翻译是 LLM 的一种可行且可测量的功能,同时强调了对目的感知指标的需求。