论文
VISTA-Bench:使用特定于图像的评分标准对多语言图像翻译进行基准测试
VISTA-Bench: Benchmarking Multilingual Image Translation with Image-Specific Rubrics
摘要
图像翻译是多语言应用的多模态模型的一项基本功能,需要跨语言的视觉理解和意义保存。然而,现有的基准测试语言覆盖范围有限,并且往往缺乏明确的特定于图像的评估标准,因此很难全面评估这种能力。为了系统地评估这种能力,我们引入了 VISTA-Bench,涵盖 22 种语言和 10 个领域,并开发了特定于图像的评估协议。该基准将语言和场景覆盖采样与模型辅助、人工验证的注释相结合,将相关文本分组为连贯的语义单元并提供多语言参考翻译。这些标准指定了基本内容、语义关系和可接受的翻译变体,为翻译质量以及视觉和知识相关信息的保存产生单独的基于输出的分数。我们对 16 个主流模型进行了广泛的评估,包括 12 个多模态模型和 4 个文本输入模型,并提供跨语言、领域和评估维度的系统分析。