论文

Stable-MM-R1:通过熵引导分层锚定多模态推理动力学

Stable-MM-R1: Anchoring Multimodal Reasoning Dynamics via Entropy-Guided Stratification

模型训练强化学习

摘要

虽然强化学习 (RL) 有效地激励了 大语言模型 中的推理,但当前的流程受到训练不稳定和快速熵崩溃的阻碍。这些限制通常源于标准采样程序中的“Rollout Silencing”和低质量梯度信号。在这项工作中,我们提出了一个强大的、以数据为中心的框架来稳定强化学习训练。我们首先介绍潜在感知查询挖掘(PAQM),它动态过滤数据以关注“蒸馏 区域”——具有高能力启发潜力的样本。此外,我们提出了混合分层重放(HSR),这是一种新颖的机制,通过基于路径熵、采样轨迹级置信代理和结果奖励的分层采样轨迹来重组批次。在每个优化步骤中,HSR 重用当前策略“稳定性锚点”和“难负样本”来构建高对比度优化组,然后在下一步之前清除其缓冲区。这种方法减轻了熵崩溃,同时提高了有限计算下学习信号的利用率。我们的方法在复杂推理任务上的性能优于强大的基线,为稳定高效的 RL 微调 提供了原则性的解决方案。