论文
MAPLE:模态感知的后训练与学习生态
MAPLE: Modality-Aware Post-training and Learning Ecosystem
摘要
多模态语言模型如今整合文本、音频与视频以实现统一推理。然而,现有RL后训练流水线将所有输入信号视为同等相关,忽视了每个任务实际需要哪些模态。这种模态盲目的训练会放大策略梯度方差、拖慢收敛,并削弱对真实世界分布偏移(信号可能缺失、被添加或被重新加权)的鲁棒性。我们提出MAPLE,一个完整的模态感知后训练与学习生态,包含:(1)MAPLE-bench,首个显式标注每项任务所需最小信号组合的基准;(2)MAPO,一个模态感知的策略优化框架,按模态需求对批次分层,以降低来自异构组优势的梯度方差;(3)自适应加权与课程调度,用于平衡并优先处理更难的信号组合。跨损失聚合、裁剪、采样与课程设计的系统性分析确立了MAPO的最优训练策略。聚焦自适应加权与课程的学习进一步提升了各信号组合上的性能。MAPLE将单模态/多模态准确率差距缩小30.24%,收敛加快3.18倍,并在现实的信号获取缩减条件下于所有模态组合上保持稳定。MAPLE构成了面向部署就绪的多模态RL后训练的完整配方。
