论文
V-Zero:无答案标签 同策略 蒸馏 具有用于细粒度视觉推理的对比证据门控
V-Zero: Answer-Label-Free On-Policy Distillation with Contrastive Evidence Gating for Fine-Grained Visual Reasoning
摘要
细粒度视觉推理需要多模态 大语言模型 (MLLM) 来识别与任务相关的视觉证据并将其推理基于局部图像区域。现有的代理方法通常依赖于具有可验证奖励的强化学习或大规模带注释的推理轨迹上的监督 微调,导致昂贵的探索、手工设计的验证规则或严重依赖文本监督。避免此类外部答案标签的自然方法是从学生自己采样的轨迹中学习,该轨迹指向 同策略 蒸馏 (OPD)。为了理解 OPD 可以和不能为视觉推理提供什么,我们将其重新审视为无负停止梯度对齐。这个观点表明,尽管 OPD 提供了有效的 词元级 校正,但其上限受到缺乏轨迹级别区分的限制。受这些观察的启发,我们提出了 V-Zero,一种无答案标签框架,用于具有对比证据门控的视觉推理。 V-Zero 不使用带注释的文本答案标签;相反,在训练期间,它将与问题相关的区域作物与负视觉视图配对,以评估学生采样的轨迹并门密集 词元级 蒸馏。多个视觉推理基准的实验表明,V-Zero 持续改进细粒度视觉推理,同时保持强大的泛化能力。值得注意的是,V-Zero 比之前的有监督 微调 方法快 5 倍以上,比强化学习基线快 10 倍以上。代码和数据集将在 https://github.com/eVI-group-SCU/V-Zero 发布