论文

图文机器翻译系统的比较评估

Comparative Evaluation of Machine Translation Systems on Images with Text

模型评测模型能力评测

摘要

这项工作对应用于包含文本信息的图像的机器翻译系统进行了比较评估,这是计算机视觉和自然语言处理的交叉任务。该研究比较了三种主要范式:将文本检测、识别和翻译分开的模块化管道;能够联合处理图像和文本的多模态 大语言模型 (MLLM);以及端到端模型 Translatotron-V,它直接生成翻译后的图像。模块化系统采用最先进的 OCR (docTR) 与多语言 LLM(例如 Llama 和 EuroLLM)相结合,而评估的 MLLM 包括 Gemini 2.5 的不同配置。实验在涵盖多个语言对的并行多语言数据集上进行,并基于 BLEU、chrF 和 TER 指标进行评估。结果表明,模块化管道的性能优于端到端方法,而 MLLM 实现了最佳的整体性能,展示了卓越的灵活性和上下文理解。这些发现强调了多模态推理在图像到文本翻译中的有效性,并为未来在多语言环境中整合视觉理解和语言生成的研究奠定了坚实的基础。