论文
控制隐性风险:持续多模态后训练的双通道风险感知强化微调
Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training
摘要
强化学习微调(RFT)在持续训练多模态大语言模型时被认为能够抵抗灾难性遗忘。然而,在显著的任务分布变化下,RFT算法之间的遗忘急剧增加。这源于RFT中的隐式奖励方差正则化,证明无法抑制不可控的优化风险。我们提出Risk-Aware Policy Optimization(RAPO),这是一种用于显式风险管理的双通道框架。在政策通道中,Risk-Aware Policy Scaling通过基于rollout可靠性和启发式局部预测敏感性的样本更新幅度来适应性地调整每步更新量;在数据通道中,Risk-Aware Dynamic Bucket Sampling通过动态风险分层重新组织训练批次,引导优化过程趋向于具有信息性但稳定的新样本。作为一种无需跨任务记忆的插件式策略,RAPO可以应用于任何RFT算法。在公开的MLLM-CL基准上,RAPO相对于其RLOO基线减少了79.8%的最终遗忘,同时保留了新任务的竞争性。
