论文

残余视觉信用优化:多模态强化学习的保守证据路由

Residual Visual Credit Optimization: Conserved Evidence Routing for Multimodal Reinforcement Learning

模型训练强化学习

摘要

具有可验证奖励的强化学习可扩展多模态推理,但结果奖励表示一条轨迹的价值,而不是该价值应如何分布在产生它的决策中。我们引入了残差视觉信用优化(RVCO),它将token信用视为保守的路由问题。受控视觉干预产生每token证据响应;稳健的轨迹内坐标消除了偶然的比例;预算熵路由器根据感知依赖性分配固定数量的序列效用。剩余支持路径保证每个有效位置的正信用,并且分析校正准确地恢复规定的信用质量。生成的字段是选择性的、有界的、完全支持的,并且对响应局部分数变化不变,并且恢复硬token选择作为极限情况。在四个模型系列和七个推理基准中,RVCO 比强大的 RLVR 基线提高了准确性,同时保持后期优化稳定性、损坏鲁棒性和具有竞争力的训练成本。奖励、执行轨迹和群体相对优势估计量不变;只是token级信用的几何形状不同。

残余视觉信用优化:多模态强化学习的保守证据路由的原论文方法或结果图
图2:RVCO的主要架构。多个受控视觉干预通过共享行为策略进行评估,同时视觉问题和生成的响应状态保持固定。由此产生的原始/干预的token响应定义了一个与决策相关的证据坐标,该坐标被转换为剩余信用字段并在精确的预算约束 $\sum_{t}g_{i,t}=m_{i}$ 下路由。然后,保守字段调整普通的策略更新,强调基于视觉的决策,同时在整个响应中保留完全支持信用。