论文

多模态视觉语言模型中的人文区域性适配

Anthropogenic Regional Adaptation in Multimodal Vision-Language Model

模型优化模型合并

摘要

尽管视觉-语言(VL)领域在跨多种语言和领域整合视觉与文本信息方面取得了显著成功,目前仍缺乏专门评估视觉语言系统中以人为中心对齐的框架。为弥合这一空白,我们做出两项贡献。第一,我们提出人文区域性适配(Anthropogenic Regional Adaptation):一种旨在优化模型与特定区域语境的相关性、同时确保保留全局泛化能力的新范式。第二,我们提出一种简单却有效的适配方法Geographical-generalization-made-easy(GG-EZ),它利用区域数据过滤与模型合并。通过在3类VL架构(大型视觉语言模型、文生图扩散模型和视觉语言嵌入模型)上的全面实验,以及东南亚(SEA)区域适配的案例研究,我们证明了人文区域性适配的重要性与GG-EZ的有效性:在SEA各区域的文化相关性指标上取得5-15%的提升,同时保持98%以上的全局性能,有时甚至反超。我们的发现将人文区域对齐(Anthropogenic Regional Alignment)确立为让多模态视觉语言模型适用于多元区域的基础性范式,并展示了一种在优化区域价值对齐的同时保留全局泛化能力的简单而有效的基线方法。

多模态视觉语言模型中的人文区域性适配:论文配图
图 1:通过人为区域适应,我们确定了两种主要模型原型:(左)全球模型具有较强的整体全球性能,但难以适当地代表某些区域;(右)区域特定模型,对某些区域具有很强的代表性,但在全球背景下表现不佳。