论文

VaaWIT:大语言模型 的视觉感知改编,用于多语言网络图像翻译

VaaWIT: Visual-Aware Adaptation of Large Language Models for Multilingual Web Image Translation

应用与实践机器翻译

摘要

翻译嵌入在网络图像中的文本对于提高内容可访问性和跨语言信息检索至关重要,特别是在社交媒体和电子商务领域。尽管大型视觉语言模型 (LVLM) 具有先进的多模态理解能力,但由于视觉表示差距,将其应用于 Web 图像翻译仍然具有挑战性:标准编码器通常优先考虑高级语义,而不是识别不同字符形态所需的细粒度视觉细节。为了应对这一挑战,我们提出了 VaaWIT,这是一个采用 大语言模型 进行多语言 Web 图像翻译的端到端框架。该框架引入了两个关键技术贡献:(1)双流注意力模块(DSAM),促进多语言语义特征和详细视觉表示之间的双向交互,从而合成对文本变化具有鲁棒性的统一特征; (2) 视觉感知适配器 (VAA),这是一种参数高效的 微调 策略,可动态地将这些融合的视觉线索注入冻结的 LLM 主干中。这种设计使模型能够有效地将视觉上下文与语言推理结合起来,同时最大限度地减少计算成本。在三个公共基准上对八项任务进行的广泛实验表明,VaaWIT 的性能显着优于最先进的 (SOTA) 开源基准,并实现了与专有模型相比的竞争性能。这些结果验证了将细粒度视觉感知集成到 LLM 中以进行复杂 Web 内容分析的功效。