论文

CAVE:一种用于碎片视觉证据推理的结构化贡献分配方法

CAVE: A Structured Credit Assignment Approach for Fragmented Visual Evidence Reasoning

模型训练奖励建模与过程监督

摘要

视觉语言模型(VLM)在一般多模态推理方面取得了强大的性能,但在集成非局部视觉信息以支持语义上不确定的视觉推理方面仍然面临挑战。我们将这一挑战描述为碎片视觉推理。为此,我们提出了视觉证据贡献分配(CAVE),这是一种基于 GRPO 的结构化过程奖励方法,用于交错视觉推理。具体来说,CAVE通过三个互补的推理过程信号:信念更新、证据获取和自适应焦点控制来评估中间步骤在动作层面的贡献,从而指导模型优化每个推理动作并学习更可靠的视觉推理策略。同时,我们构建了TRACER-Bench,它涵盖了四个非局部和语义混淆的推理维度,并为监督推理路径提供了关键的中间证据。实验表明,CAVE 显着提高了需要碎片视觉证据集成的任务的性能,涵盖公共基准和我们新推出的 TRACER-Bench,同时保留一般多模式评估的竞争性能。进一步分析表明,CAVE有效提高了视觉推理能力,并在更远距离、更深的跨区域依赖下表现出更强的鲁棒性。