论文
用于遵循指令的泰英机器翻译的参考数据管理
Reference-Grounded Data Curation for Instruction-Following Thai-English Machine Translation
摘要
指令遵循机器翻译 (IF-MT) 需要遵守术语、格式和语体方面的提示级规则。规则合规性通常会与翻译质量进行权衡,这是通用 IF 数据增强方法无法解决的问题。我们提出了基于参考的数据管理,这是一个两阶段的管道,它从已经满足它的参考翻译中提取每个监督约束,从而确保构建的可行性。第 1 阶段应用指令遵循难度 (IFD) 评分,以保留英语-泰语并行池中最难但可学习的实例。第 2 阶段从每个参考目标中提取约束,并仅保留满足全部约束的生成结果,从而生成 197 万条记录的 Grounded 数据集。我们在 Grounded 的基础上微调开放权重以产生 ChindaMT,这是一个具有 4B、2B 和 0.8B 参数的泰语-英语翻译系列。在长度控制的成对判断下,ChindaMT 在简单翻译和明确规则下都优于或匹配每个级别的每个相同大小的基线,对最强基线的胜率高达 68.4%。该配方在 Qwen 几代人之间清晰地传承。我们发布模型权重、Grounded数据集和评估套件。