论文
残余视觉信用优化:多模态强化学习的保守证据路由
Residual Visual Credit Optimization: Conserved Evidence Routing for Multimodal Reinforcement Learning
摘要
具有可验证奖励的强化学习可扩展多模态推理,但结果奖励表示一条轨迹的价值,而不是该价值应如何分布在产生它的决策中。我们引入了残差视觉信用优化(RVCO),它将token信用视为保守的路由问题。受控视觉干预产生每token证据响应;稳健的轨迹内坐标消除了偶然的比例;预算熵路由器根据感知依赖性分配固定数量的序列效用。剩余支持路径保证每个有效位置的正信用,并且分析校正准确地恢复规定的信用质量。生成的字段是选择性的、有界的、完全支持的,并且对响应局部分数变化不变,并且恢复硬token选择作为极限情况。在四个模型系列和七个推理基准中,RVCO 比强大的 RLVR 基线提高了准确性,同时保持后期优化稳定性、损坏鲁棒性和具有竞争力的训练成本。奖励、执行轨迹和群体相对优势估计量不变;只是token级信用的几何形状不同。
