论文
CARE:视频 MLLM 中自适应推理长度的能力感知奖励塑造
CARE: Competence-Aware Reward Shaping for Adaptive Reasoning Length in Video-MLLMs
摘要
在多模态视频推理中,基于强化学习的方法通常依赖于简单且不灵活的推理长度控制策略,无法适应模型不断发展的能力。这种不匹配可能会抑制早期阶段必要的探索,同时一旦模型变得更有能力,就会鼓励冗余推理和低效解码。在本文中,我们提出了 CARE,一种用于多模态推理中自适应推理长度优化的能力感知奖励塑造框架。具体来说,CARE 通过通过率的指数移动平均值来维持平滑的能力估计,并用它来将训练路由到渐进阶段,将奖励偏好从以探索为导向的长式推理转变为以效率为导向的简洁推理。为了避免将冗长的内容与内在的任务复杂性混为一谈,CARE 通过批量级统计进一步标准化推理工作,并引入后置放大器来增强奖励信号,从而在历史上困难的样本上获得意想不到的强大性能。所提出的机制无缝集成到 GRPO 训练流程中,并且不会产生额外的推理时间开销。对多个视频推理和通用视频理解基准的大量实验表明,CARE 持续提高推理准确性,稳定强化学习,并显着提高词元效率。此外,CARE 在训练期间表现出推理长度的倒 U 型轨迹特征,并在收敛时产生更短但信息更丰富的推理轨迹,表明推理预算的有效自适应分配。我们在 https://github.com/1Pansy/Video-CARE 上提供了我们提出的 CARE 框架和实验的源代码。