论文

Doc2FRC:通过固定范围分块实现长度一致的文档级机器翻译

Doc2FRC: Length-Consistent Document-Level Machine Translation via Fixed-Range Chunking

上下文与知识上下文工程

摘要

具有长上下文窗口的高级大型语言模型 (LLM) 可以大大减少文档级机器翻译 (DocMT) 中的输入截断。然而,直接 Doc2Doc 翻译仍然容易出现 n 元重复和质量逐渐下降。常见的补救措施是将文档分割成更细粒度的块。尽管如此,传统的基于规则的分块方法无法处理训练和推理之间的长度分布不匹配。为了解决这个问题,我们引入了固定范围分块(FRC),利用动态编程将文档划分为预定义长度间隔内的块。通过在训练和推理过程中一致应用 FRC,任何长度的输入文档都会映射到相同的长度分布,从而大大减少训练与测试长度不匹配。以 FRC 为中心,我们提出了一种用于块对齐的轻量级双边界匹配算法,以及四种不同的训练策略。实验结果表明,基于 FRC 的微调比直接 Doc2Doc 微调大大提高了 7B LLM,并且在 IWSLT2017 上优于现有的 DocMT 方法。我们进一步构建了独立于主流 DocMT 训练源的 10 种语言测试集 GlobVDoc,并表明 FRC 改进了分发外文档翻译。