论文

MAPLE:模态感知的后训练与学习生态

MAPLE: Modality-Aware Post-training and Learning Ecosystem

模型训练强化学习

摘要

多模态语言模型如今整合文本、音频与视频以实现统一推理。然而,现有RL后训练流水线将所有输入信号视为同等相关,忽视了每个任务实际需要哪些模态。这种模态盲目的训练会放大策略梯度方差、拖慢收敛,并削弱对真实世界分布偏移(信号可能缺失、被添加或被重新加权)的鲁棒性。我们提出MAPLE,一个完整的模态感知后训练与学习生态,包含:(1)MAPLE-bench,首个显式标注每项任务所需最小信号组合的基准;(2)MAPO,一个模态感知的策略优化框架,按模态需求对批次分层,以降低来自异构组优势的梯度方差;(3)自适应加权与课程调度,用于平衡并优先处理更难的信号组合。跨损失聚合、裁剪、采样与课程设计的系统性分析确立了MAPO的最优训练策略。聚焦自适应加权与课程的学习进一步提升了各信号组合上的性能。MAPLE将单模态/多模态准确率差距缩小30.24%,收敛加快3.18倍,并在现实的信号获取缩减条件下于所有模态组合上保持稳定。MAPLE构成了面向部署就绪的多模态RL后训练的完整配方。

MAPLE:模态感知的后训练与学习生态
图2:MAPLE-bench 数据构建(curation)流水线概览。种子视频从大规模语料库中采样,并被分解为音频、视觉和文本流。每种模态都经过独立标注和跨模态一致性对齐,然后再生成描述文本(captions)和查询—响应对。随后,模态隔离的提示阶段在单模态、双模态和三模态配置下合成任务,产出一个平衡的数据集,用于模态感知的后训练。