论文

经增量优化效用的多模态模型高效数据选择

Efficient Data Selection for Multimodal Models via Incremental Optimization Utility

模型训练合成数据

摘要

大型多模态模型 (LMM) 的扩展受到合成数据固有的质量与数量权衡的限制。以前的方法,例如LLM作为法官,已经证明了它们在解决这个问题方面的有效性,但受到计算成本过高和缺乏可解释性的困扰。为了弥补这一差距,我们提出了一步训练(OST),这是一种将数据选择重新表述为增量优化效用排名问题的框架。 OST 不依赖语义启发法,而是通过轻量级代理上的模拟单步更新来估计每个样本的边际效用。在 Qwen 系列上跨多模态数学推理基准的实验表明 OST 实现了帕累托最优效率。通过选择前 50 个子集,OST 将训练成本降低了 43%(总时间消耗减少了 17%),同时超过了 LLM-as-a-Judge 的强大基线 1.8 个百分点。此外,在固定的计算预算下,我们的方法仅使用前 20 个子集,比作为法官的 LLM 获得了 5.6 分的收益,改进了 DEITA 等启发式评分基线,并且比 Full-SFT 基线高了 8.8 分。值得注意的是,虽然 Full-SFT 因噪声而导致性能下降,但我们基于优化的方法有效地识别了有毒样本,成功逆转了复杂推理任务中经常观察到的负迁移。

经增量优化效用的多模态模型高效数据选择:论文配图
图 1. 一步训练 (OST) 管道概述。该过程将选择重新表述为三个有效阶段:(1)代理评分:轻量级代理模型通过测量模拟单梯度更新后的验证损失减少来估计每个样本的边际效用(Δi\Delta_{i})。 (2) 排名和选择:样本按其更新实用程序排序,过滤出高价值的 top-pp% 子集。 (3)目标训练:大目标模型专门在此子集上进行微调,有效逆转负迁移。