论文
符合政策的视觉证据蒸馏
On-Policy Visual Evidence Distillation
摘要
视觉Agent通过交叉推理与图像操作来解决问题,并且策略蒸馏(OPD)提供了强大的老师对学生生成的交互轨迹的指导。然而,图像操作会改变可用于后续推理的证据,因此证据获取 (Acquire)、阅读 (Read) 或答案grounding (Ground) 中的局部错误可能会通过轨迹传播并导致不正确的答案。现有的多模态 OPD 方法主要构建或对比原始图像的辅助视图以加强监督,而没有明确建模学生行为、结果观察和后续推理之间的联系。这限制了他们针对不同故障阶段提供定制修正的能力。我们引入了视觉证据反射(ReVuE),这是一种用于视觉Agent的策略蒸馏方法。 ReVuE 比较同一查询的多个学生生成的轨迹,总结观察到的视觉证据,并诊断获取、阅读和基础阶段的第一次失败。由此产生的反思为教师提供了训练时间背景。我们根据这些反射对教师预测的影响程度对词元级蒸馏损失进行分组和重新加权。该设计将轨迹级证据诊断转化为有针对性的词元级监督,引导学生提高视觉证据获取和推理能力。在涵盖 Qwen2.5-VL 和 InternVL3.5 模型系列的 11 个基准测试中,ReVuE 在感知、数学推理和一般任务的加权平均得分方面优于所有评估的 OPD 基线。 ReVuE 还减少了推理和工具调用的冗余,同时提高了工具调用的准确性和任务准确性。代码可在 https://github.com/sylvain-wei/ReVuE 获取