论文
问题真的重要吗?面向视觉语言SFT的免训练数据选择
Does the Question Really Matter? Training-Free Data Selection for Vision-Language SFT
摘要
视觉指令微调对提升视觉语言大模型(VLLM)至关重要。然而许多样本可凭语言模式或常识捷径解决,无需真正跨模态推理,限制了多模态学习的成效。已有数据选择方法常依赖代价高昂的代理模型训练,且聚焦难度或多样性,无法刻画样本对视觉语言联合推理的真实贡献。本文提出免训练数据选择方法CVS,其洞见是:对高质量多模态样本而言,引入问题应显著改变模型在给定图像下对答案有效性的判断。CVS用冻结VLLM作评估器,度量有无问题条件下答案有效性的差异,从而识别需要视觉语言联合推理的样本并滤除语义冲突噪声。在Vision-Flan与The Cauldron上的实验表明CVS在各数据集均表现稳健。在Vision-Flan上,CVS仅用10%和15%数据即比全量训练高出3.5%和4.8%,且在高度异构的Cauldron数据集上依然稳健。与COINCIDE和XMAS相比,CVS分别降低17.3%和44.4%的计算成本。
