论文经最差维度优化改进多模态推理Improving Multimodal Reasoning via Worst Dimension OptimizationHaocheng Lv; Huaping Zhang; Qiuchi Li; Lei Li; Chunxiao Gao·来源日期:2026.06.05模型训练奖励建模与过程监督收藏摘要原文译文多模态推理需要一条在从视觉基础到逻辑一致性的各种约束下保持完整性的路径。然而,当前的过程奖励模型侧重于同等权衡这些因素的启发式定义的奖励,这可能导致主导因素掩盖个体维度的失败,而不能保证推理过程的有效性。图 1:现有方法与我们的方法之间的比较。