论文

MixAtlas:多模式 LLM 中期训练的不确定性感知数据混合优化

MixAtlas: Uncertainty-aware Data Mixture Optimization for Multimodal LLM Midtraining

模型训练合成数据

摘要

域重新加权可以提高样本效率和下游泛化,但多模态中间训练的数据混合优化在很大程度上仍未得到探索。当前的多模式训练方法沿着单一维度(通常是数据格式或任务类型)调整混合物。我们引入了 MixAtlas,这是一种生成基准目标数据配方的方法,可以检查、调整这些数据配方,并将其转移到新的语料库中。 MixAtlas 沿着两个轴分解训练语料库:图像概念(通过 CLIP 嵌入发现的 10 个视觉域集群)和任务监督(5 种目标类型,包括图像描述、OCR、目标定位、检测和 VQA)。使用小型代理模型 (Qwen2-0.5B) 与高斯过程代理和 GP-UCB 采集相结合,MixAtlas 使用与基于回归的基线相同的代理预算搜索生成的混合空间,但找到性能更好的混合。我们评估了涵盖视觉理解、文档推理和多模态推理的 10 个基准。在 Qwen2-7B 上,优化后的混合物比最强基线提高了 8.5%-17.6% 的平均性能;在Qwen2.5-7B上,增益为1.0%-3.3%。两种设置均可以最多减少 2 倍的步数达到基线等效训练损失。在 0.5B 代理上发现的配方可转移到 Qwen 模型系列的 7B 规模训练。