论文

BabelDOC:通过中间表示更好地保留布局的 PDF 翻译

BabelDOC: Better Layout-Preserving PDF Translation via Intermediate Representation

应用与实践机器翻译

摘要

随着全球跨语言交流的加剧,PDF 等视觉丰富的文档中的语言障碍仍然是一个实际瓶颈。现有的文档翻译流程面临着语言处理和布局保留之间的紧张关系:面向文本的计算机辅助翻译(CAT)系统经常丢弃结构元数据,而文档解析器专注于提取,不支持翻译后忠实的重新渲染。我们介绍 BabelDOC,一个基于中间表示 (IR) 的框架,用于保留布局的 PDF 翻译。 BabelDOC 将视觉布局元数据与语义内容解耦,从而实现文档级翻译操作,例如术语提取、跨页面上下文处理、术语表约束生成和公式占位符。然后,翻译后的内容通过自适应排版引擎重新锚定到原始布局。对精心策划的 200 页基准测试以及人工评估和多模式 LLM 作为法官评估的实验表明,BabelDOC 相对于代表性基线提高了布局保真度、视觉美感和术语一致性,同时保持有竞争力的翻译精度。该开源工具包及其交互式下游应用程序是公开可用的,截至撰写本文时已吸引了超过 8400 名 GitHub 明星和 17 名贡献者。还提供演示视频。