论文
DyCPO:视频推理的自诊断多角色词元优化
Beyond Entropy: Self-Diagnostic Multi-Role Token Optimization for Video Reasoning
摘要
可验证奖励的强化学习实质推进了多模态推理,但根本上仍受制于含糊的token级信用分配。高熵token启发鼓励可能性探索,但朴素扩展到视频推理会诱发冗长推理——模型过度依赖高熵视觉激活;依赖反事实视觉token定位做信用分配的替代方法也倾向于牺牲答案推导的决定性推理线索而过度优先视觉探索,加剧伪视觉细节的干扰;且这些方法采用静态反事实策略,无法在训练中与策略共同演化。本文提出DyCPO——共同演化框架:联合优化可靠token选择与自适应反事实干预。它构建多角色依赖度量,在token级对比学习中平衡视觉探索与答案相关性挖掘,同时抑制纯探索的填充token与伪视觉噪声;不依赖静态反事实先验,DyCPO从模型自身的成败rollout动态导出反事实信号,实现自诊断分析及优化目标与策略的共同演化。复杂视频推理与一般视频理解基准的大量实验展示一致的性能改进,确立DyCPO为多模态强化学习鲁棒的token级信用分配范式。