论文
UniTranslator:用于端到端图像内机器翻译的统一多模态框架
UniTranslator: A Unified Multi-modal Framework for End-to-end In-Image Machine Translation
摘要
图像内机器翻译 (IIMT) 旨在翻译图像中的场景文本,并将翻译后的文本渲染回原始区域,同时保留整体视觉外观。最近的统一多模态模型通过将视觉文本理解和图像生成结合在一个框架内,提供了一个有前途的解决方案。然而,直接使此类模型适应 IIMT 仍然具有挑战性。特别是,它们经常遭受理解生成冲突(理解过程中推断的翻译与生成中使用的文本监督不一致)和空间位置错位(渲染文本与目标文本区域不准确匹配)。为了解决这些问题,我们提出了 UniTranslator,这是一个统一的 IIMT 多模式框架,它将翻译理解和文本编辑紧密结合在一起。具体来说,我们引入了理解生成对齐模块(UGAM)来弥合理解和生成之间的表示差距,从而鼓励翻译内容预测和文本渲染之间的语义一致性。我们进一步提出了一种对文本区域进行像素级监督的空间掩模解码器(SMD),以改善生成过程中的空间定位、几何对齐和布局可控性。对多个基准的大量实验表明,UniTranslator 在不同的语言方向和复杂的现实世界布局中实现了最先进的性能。此外,我们的结果揭示了翻译理解和图像生成之间强大的相互强化效应,凸显了统一翻译多模态学习的优势。代码可在 https://github.com/SeerRay-Lab/Unitranslator 获取。