论文
经增量优化效用的多模态模型高效数据选择
Efficient Data Selection for Multimodal Models via Incremental Optimization Utility
摘要
大型多模态模型 (LMM) 的扩展受到合成数据固有的质量与数量权衡的限制。以前的方法,例如LLM作为法官,已经证明了它们在解决这个问题方面的有效性,但受到计算成本过高和缺乏可解释性的困扰。为了弥补这一差距,我们提出了一步训练(OST),这是一种将数据选择重新表述为增量优化效用排名问题的框架。 OST 不依赖语义启发法,而是通过轻量级代理上的模拟单步更新来估计每个样本的边际效用。在 Qwen 系列上跨多模态数学推理基准的实验表明 OST 实现了帕累托最优效率。通过选择前 50 个子集,OST 将训练成本降低了 43%(总时间消耗减少了 17%),同时超过了 LLM-as-a-Judge 的强大基线 1.8 个百分点。此外,在固定的计算预算下,我们的方法仅使用前 20 个子集,比作为法官的 LLM 获得了 5.6 分的收益,改进了 DEITA 等启发式评分基线,并且比 Full-SFT 基线高了 8.8 分。值得注意的是,虽然 Full-SFT 因噪声而导致性能下降,但我们基于优化的方法有效地识别了有毒样本,成功逆转了复杂推理任务中经常观察到的负迁移。
