论文

没有图像的思考:通过 同策略 自我 蒸馏 内化视觉操作

Thinking Without Images: Internalizing Visual Manipulation with On-Policy Self-Distillation

摘要

“用图像思考”已成为细粒度视觉推理的有效范例:通过明确放大相关区域并对作物进行推理,模型可以获取难以从单个全局图像中恢复的局部证据。然而,这种好处伴随着冗余的工具调用和更长的推理跟踪。此外,当主要从结果奖励中学习此类行为时,由此产生的中间作物或视觉线索可能会很吵闹或无法忠实地捕获与任务相关的视觉证据。在这项工作中,我们询问“用图像思考”的推理优势是否可以通过“用想象力思考”来内化:这是一个内部过程,决定在哪里看并想象仔细检查会揭示什么视觉线索,而无需实际调用工具。我们提出了 Imagine-OPD,一个 同策略 自 蒸馏 框架,其中教师在训练期间扮演“用图像思考”推理者的角色:它接收来自注释区域的特权缩放证据视图,并监督模型自己的想象推理轨迹。 Imagine-OPD 不需要外部教师或高质量的想象力演示。以视觉为中心的基准测试表明,与“用图像思考”方法相比,Imagine-OPD 在比较模型中实现了最佳平均性能,同时显着降低了推理开销。