论文

V-tableR1:基于评论家引导策略优化的过程监督多模态表格推理

V-tableR1: Process-Supervised Multimodal Table Reasoning with Critic-Guided Policy Optimization

模型训练强化学习RLVR

摘要

我们提出V-tableR1,一个从多模态大语言模型(MLLM)中引出严谨、可验证推理的过程监督强化学习框架。仅在最终结果上训练的现有MLLM常把视觉推理当作黑箱,依赖表面模式匹配而非执行严谨的多步推理。虽然可验证奖励强化学习(Reinforcement Learning with Verifiable Rewards)能够强化透明的推理轨迹,但将其扩展到视觉领域仍严重受阻于把抽象逻辑落地到连续像素空间的歧义性。我们利用表格的确定性网格结构作为理想视觉试验场来解决这一问题。V-tableR1采用专用的评论家VLM,对策略VLM生成的显式视觉思维链提供密集的步骤级反馈。为优化该系统,我们提出Process-Guided Direct Alignment Policy Optimization(PGPO),一种整合过程奖励、解耦策略约束与长度感知动态采样的新型RL算法。大量评估表明,V-tableR1能显式惩罚视觉幻觉与投机取巧的猜测。通过将多模态推理从黑箱模式匹配根本性地转变为可验证的逻辑推导,V-tableR1 4B在复杂表格基准上建立了开源模型中的最先进准确率,胜过参数量至多18倍于它的模型,并优于其SFT基线。

V-tableR1:基于评论家引导策略优化的过程监督多模态表格推理:论文配图
图 1:用于表推理的结果监督式 VLM 和过程监督式 VLM 之间的比较。过程监督使模型能够准确定位相关单元并遵循逻辑步骤,从而在黑盒推理失败时得出正确答案。