论文
Format:基于视觉的多语言 PDF 翻译数据集
ForMaT: Dataset for Visually-Grounded Multilingual PDF Translation
摘要
我们提出了 ForMaT(保留格式的多语言翻译),这是一个包含 15 个语言对的 3,956 个 PDF 的并行语料库,它保留了为多模式机器翻译提出的原始布局元数据。为了确保数据集中的结构多样性,我们采用 K-Medoids 对超过 45 个几何特征进行采样,捕获嵌套表格和公式等复杂元素,以仅关注视觉上多样化的 PDF 文档。我们的评估表明,当前的机器翻译系统在空间基础和几何同步方面遇到困难,经常失去文本与其视觉上下文之间的联系。 ForMaT 为开发布局感知翻译模型提供了基准,该模型集成了视觉和文本上下文以进行高保真文档重建。