论文
MMTIT-Bench:认知-感知-推理引导的文本-图像机器翻译多语言、多场景基准
MMTIT-Bench: A Multilingual and Multi-Scenario Benchmark with Cognition-Perception-Reasoning Guided Text-Image Machine Translation
摘要
端到端文本图像机器翻译(TIMT)可以跨语言直接翻译图像中的文本内容,对于现实世界的多语言场景理解至关重要。尽管视觉语言大型模型(VLLM)取得了进步,但由于评估资源有限,跨不同视觉场景和低资源语言的鲁棒性仍未得到充分探索。我们推出了 MMTIT-Bench,这是一个经过人工验证的多语言和多场景基准,包含 1,400 张图像,涵盖 14 种非英语和非汉语语言以及文档、场景和网络图像等多种设置,从而能够对端到端 TIMT 进行严格评估。除了基准测试之外,我们还研究面向推理的数据设计如何改进翻译。尽管最近的 VLLM 已经开始融入长思维链 (CoT) 推理,但 TIMT 的有效思维范式仍然不成熟:现有设计要么按顺序进行级联解析和翻译,要么专注于纯语言推理,忽视了 VLLM 的核心视觉认知。我们提出了翻译认知-感知-推理(CPR-Trans),这是一种将场景认知、文本感知和翻译推理集成到统一推理过程中的数据范式。使用 VLLM 驱动的数据生成管道,CPR-Trans 提供结构化、可解释的监督,使感知与推理保持一致。 3B 和 7B 模型的实验显示了准确性和可解释性的持续提升。验收后我们将发布MMTIT-Bench,推动多语言、多场景的TIMT研究。