论文
V-Rubrics:通过基于 Rubric 的强化学习实现 Visual 忠实性
V-Rubrics: Visual Faithfulness via Rubric-Based Reinforcement Learning
摘要
视觉语言模型可以产生流畅的答案,但这些答案没有充分基于视觉证据:单个不受支持的对象、图表值或中间推理可能会破坏原本合理的响应。我们认为这是多模态 后训练 中的信用分配失败。标量结果奖励表明答案是否可以接受,但不能识别哪些视觉事实是有根据的,哪些推理步骤是有效的,或者错过了哪些指令约束。我们引入了基于 Visual Rubrics 的强化学习,它将参考响应分解为原子命题,并根据 Visual 忠实性 (VF)、推理一致性 (RC) 和指令遵循 (IF) 对生成的答案进行评分。当支持证据跨度可用时,生成的评分项提供结构化的部分信用并本地化评分表信用。我们首先通过 微调 Qwen3-VL-8B-Instruct 在公共 OpenMMReasoner-SFT-874K 语料库上获取 SFT 检查点,采用 OpenMMReasoner 的冷启动数据配方。我们构建了 V-Rubrics 50K,这是一个来自 17 个视觉基础来源的 50,248 个示例训练集,通过应用基于规则的过滤器,然后从拒绝采样分数得出示例难度,然后在相同的结构化提示和协议下使用 Gemini-3-Pro 注释每个示例。我们使用组件方面的、前缀本地化的评分标准信用,基于相同的 SFT 检查点来训练我们的模型。实验表明,我们基于标题的 GRPO 比共享 SFT 基线和仅答案 GRPO 都有所改进,在以知识为导向和基于视觉的推理基准上获得了最大的收益。结果表明,评分细则对于视觉 后训练 来说是一种有用的奖励抽象。