论文

经最差维度优化改进多模态推理

Improving Multimodal Reasoning via Worst Dimension Optimization

模型训练奖励建模与过程监督

摘要

多模态推理需要一条在从视觉基础到逻辑一致性的各种约束下保持完整性的路径。然而,当前的过程奖励模型侧重于同等权衡这些因素的启发式定义的奖励,这可能导致主导因素掩盖个体维度的失败,而不能保证推理过程的有效性。

经最差维度优化改进多模态推理:论文配图
图 1:现有方法与我们的方法之间的比较。