论文

CAST:用于多模态核心集选择的折叠感知多尺度拓扑融合

CAST: Collapse-Aware multi-Scale Topology Fusion for Multimodal Coreset Selection

模型训练合成数据

摘要

大型多模态模型的训练从根本上依赖于大量的图像文本数据集,这不可避免地会产生高昂的计算开销。数据集选择通过识别信息丰富的核心集提供了一个有前途的范例。然而,现有方法存在两个关键局限性:(i)单模态主导的采样方法,它忽略了多模态数据集中固有的细粒度跨模态信息不平衡,从而导致其他模态的语义丢失; (ii)基于粗粒度样本评分的采样方法,其中所选的核心集往往偏向评分模型,从而难以保证核心集和原始数据集之间的分布等效性。同时,现有的分布匹配和离散采样策略往往无法共同考虑密集区域的全局语义结构、局部细粒度细节和冗余感知覆盖。为此,我们提出了 CAST,一种用于多模式核心集选择的 Collapse-Aware 多尺度拓扑融合框架。我们首先构建图像和文本模态拓扑,并通过局部折叠感知细化和跨模态融合导出统一的拓扑。然后,我们在扩散小波域中引入多尺度分布匹配标准,鼓励核心集在多个尺度上逼近原始数据集。最后,我们引入了一种局部软关系覆盖机制,将纯几何覆盖扩展到关系感知的间接覆盖,惩罚密集集群中的冗余选择。在 Flickr30K 和 MS-COCO 上进行的大量实验表明,CAST 的性能优于现有的数据集选择基线,与最先进的多模态合成方法相比,在跨架构泛化和能源效率方面表现出巨大的优越性。