论文
多模式指令调优中的数据组织问题:能力权衡的对照研究
Data Organization Matters in Multimodal Instruction Tuning: A Controlled Study of Capability Trade-offs
摘要
最近的多模态 大语言模型 (MLLM) 在一般视觉理解、图表推理以及以文档为中心的感知方面表现出色。然而,这些能力是从具有截然不同的任务结构和学习需求的异构监督源中学习的,并且它们在训练期间的时间组织的效果仍未得到充分探索。我们研究数据组织是否影响多模式指令调整中一般理解、结构化推理和细粒度 OCR/文档理解之间的权衡。为了隔离这个因素,我们使用受控的三阶段训练框架,其中主干、可训练模块和优化管道在所有运行中都是固定的,并且仅改变对齐后监督的时间安排。我们比较了四种策略:直接混合、课程训练、平衡抽样和逆向课程。一般视觉指令遵循、图表推理、图表推理、场景文本问答和文档问答的实验表明,数据组织是多模态适应中的一阶设计变量。课程训练给出了最好的整体权衡和最强的结构化推理性能。平衡采样对于面向 OCR 的能力更好,但会削弱更广泛的能力平衡。逆向课程在最终性能和优化稳定性方面表现最差。训练动态分析进一步表明,在引入 OCR 密集型监督之前建立一般理解和推理可以实现更平滑的优化和更快的收敛。这些发现强调数据调度是多模式模型适应的明确设计维度。