论文

VLM何时该看?只为必要且被使用的视觉调用付费

When Should a VLM Look? Paying Only for Visual Calls That Were Needed and Used

模型训练强化学习奖励建模与过程监督RLVRAgentic RL

摘要

裁剪和放大的视觉-语言智能体通常以奖励成功工具调用的方式训练,但一次成功的调用并不能说明模型确实需要查看、或确实使用了收到的像素。在我们的冷启动检查点上,只有 10% 到 12% 的视觉调用既必要又被使用,而已发布的智能体在各个基准上做出无谓调用的比例达 36% 到 87%。结果奖励、评判奖励和分支探测各自只观察到这一失败的一面,结果奖励的支出中约三分之二流向了既不必要也未被使用的调用。CounterCredit 在每次返回图像的调用发生前的真实状态下追问这两个问题,使用策略自身的金标准答案得分:决策值比较“实际查看分支”与“立即作答”;证据值将返回的裁剪图与随机同尺寸图块代入同一调用进行比较。两项都通过验证的调用获得返现,其余每个已执行的调用支付租金;价格设置有界,使每条正确轨迹都优于每条错误轨迹,并用双通道 GRPO 优势保持价格处于自身单位。在相同的冷启动、提示池和预算下,CounterCredit 在 V* 上达到 89.5%,HR-Bench-4K 上达到 80.2%,HR-Bench-8K 上达到 76.4%,比仅用结果奖励的 GRPO 高 6.3 到 9.4 分,同时每题调用数为 1.78 对 1.84,并将无谓调用率降至 31% 到 36%,为所评测智能体中最低。同一方法将 Qwen3-VL-8B 基座的平均成绩从 75.4 提升到 80.8。

VLM何时该看?只为必要且被使用的视觉调用付费:论文配图
图 1:虚假视觉调用概览。(a) 已发布视觉智能体的虚假调用率。(b) 冷启动检查点上不同奖励方案所“支付”的调用占比,按是否必要、是否被使用划分;每根柱子上方的数字是每 100 次执行所支付的调用数。两个面板均在 V∗、HR-Bench-4K 与 HR-Bench-8K 上取平均。(c) 固定前缀反事实,在保持各续写之间调用前实际状态一致的前提下,将“调用是否必要”与“证据是否被利用”区分开。