论文

MNAFT:用于图像翻译的多模态 大语言模型 的模态神经元感知 微调

MNAFT: modality neuron-aware fine-tuning of multimodal large language models for image translation

模型训练参数高效训练

摘要

多模态 大语言模型 (MLLM) 已显示出令人印象深刻的功能,但它们常常难以有效捕获图像中对于准确图像翻译至关重要的细粒度文本信息。这通常会导致视觉文本输入和图像翻译的文本输入/输出之间存在模态差距。现有方法主要依赖微调指令,存在预训练知识参数冗余的风险,阻碍泛化性能。为了解决这个问题,我们引入了模态神经元感知 微调 (MNAFT),这是一种利用 MLLM 中单个神经元的特殊作用来增强图像翻译的新颖方法。 MNAFT 通过指令驱动的激活分析来识别视觉和语言模块中与语言无关和语言特定的神经元,评估它们在各种翻译任务中的重要性。然后,我们执行选择性 微调,仅更新与目标任务相关的选定层中特定于语言和与语言无关的神经元的参数,同时保留其他神经元和层中编码的知识。我们对多个基准进行的广泛实验表明,MNAFT 显着优于最先进的图像转换方法,包括级联模型、标准完整 微调 和参数高效的调整技术。此外,我们提供全面的分析,包括神经元激活和聚类模式的可视化,以深入了解不同神经元组在介导跨模式理解和促进准确的特定语言翻译中的作用。