论文

按视觉贡献加权损失改善多模态翻译

Improving Visual Sensitivity of LLMs on Multimodal Machine Translation with Metric-based Loss Weighting

模型训练监督微调与指令调优

摘要

多模态机器翻译旨在合并来自非文本模态的额外信号,通过解决歧义来改进翻译。虽然模型通过多模态融合能够接受与源文本相关的图像,但它们可以忽略此信息。因此,提高他们的视觉敏感性仍然是一个活跃的研究领域。在这项工作中,我们引入了一种训练方法,即基于度量的损失加权,该方法通过增加受益于随附图像的标记的损失函数来改善翻译的视觉基础。我们使用逐点交叉互信息 (PCXMI) 指标来识别这些标记,该指标比较有视觉上下文和没有视觉上下文的模型的输出概率。我们引入了基于一致性的 PCXMI 指标,并通过实验表明,两种指标结合使用可产生最佳结果。我们通过在三个语言方向的图像引导机器翻译任务上微调三个预训练的多模态大语言模型来评估我们的方法。基于指标的损失加权在 CoMMuTE 对比数据集上优于其他经过测试的方法,与标准微调相比,准确率提高了 7 个百分点以上,同时保持了强大的总体翻译性能。

先计算token对图像的依赖,再提高这些token的训练损失权重。
图1(图注摘要):先计算token对图像的依赖,再提高这些token的训练损失权重。