论文

VIDA:多模态机器翻译中视觉相关歧义的数据集

VIDA: A Dataset for Visually Dependent Ambiguity in Multimodal Machine Translation

模型评测基准与评测资源

摘要

歧义解决是多模态机器翻译 (MMT) 中的一个关键挑战,其中模型必须真正利用视觉输入将歧义表达映射到其预期含义。尽管之前的工作提出了以消歧为导向的基准来探讨视觉的作用,但我们观察到现有的基准仍然受到任务格式不匹配、歧义覆盖范围窄或视觉依赖性验证不足的限制。此外,现有的歧义评估不太适合开放式翻译中的多种歧义类型。为了解决这些限制,我们提出了 VIDA(视觉相关歧义),这是一个包含 2,500 个精心策划的实例的数据集,其中解析带注释的源跨度需要视觉证据。我们进一步提出以消歧为中心的指标,使用 LLM 作为判断分类器来验证带注释的歧义表达式是否在跨度级别上得到正确解析。对近期更强的 LVLM 的评估表明,视觉消歧仍然具有挑战性。使用思想链监督 微调 作为诊断设置,我们观察到比 SFT 更强的分布外消歧,在集体名词歧义方面具有强劲的增益,在句子级歧义方面具有模型相关的增益。