论文

TransAnyText:通过结构化视觉生成翻译电子商务图像中的任意文本

TransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation

摘要

跨境电商图片翻译对于全球零售至关重要,产品图片、横幅和详情页需要用不同语言制作。现有的方法很难同时实现准确的翻译、忠实的视觉身份保留和易于编辑的输出。为了应对这些挑战,我们引入了 TransAnyText,这是一个结构化可视化代码框架,它将图像文本翻译重新定义为从源图像和目标语言生成可渲染的 HTML 补丁。我们的框架将语义生成与像素渲染分离:视觉语言模型(VLM)处理视觉理解、跨语言翻译和结构化视觉生成,而扩散模型执行背景修复和像素级细化,然后进行确定性渲染以合成最终图像。基于这个公式,我们开发了一个三阶段的 后训练 框架,其中监督 微调 (SFT) 建立了图像到代码的映射,特权间隙加权自 蒸馏 (PWSD) 改进了样式和布局标记的学习,具有可验证奖励的强化学习 (RLVR) 进一步优化了任务级性能。我们进一步介绍 TransAnyDataset 和 TransAnyBench,这是一个电子商务图像翻译的多语言数据集和基准。大量的实验证明了与级联管道、开源端到端模型和闭源图像编辑系统的竞争性能,为跨境电商图像翻译提供了有效、可控、可编辑的解决方案。