论文

通过对比课程学习有效缩放

Learning to Zoom Efficiently with a Contrastive Curriculum

模型训练强化学习

摘要

使用放大工具是现代视觉代理的重要基础部分,因为它可以有效地处理涉及高分辨率图像的任务。大多数以前的方法需要一个广泛的热启动监督 微调 阶段来教学模型放大。我们通过为 MLLM 中的学习工具使用提出新的内在奖励来证明这是不必要的,而不需要额外的标签或热启动 SFT。我们的 InfoNCE 式奖励使用越来越难的负面工具调用课程作为对比训练信号。在 $V^*$、HRBench 和 MME-RealWorld 上的实证实验表明,我们的方法在更高效的同时具有竞争力。当用作 SFT 的直接替代品时,我们甚至优于所有基线。为了直接测量模型的放大能力,我们进一步引入了可扩展的合成 Muffin&Chihuahua(M&C)数据集。每张图像都由一个网格组成,每个单元格要么显示松饼,要么显示吉娃娃。利用 M&C 数据集独特的感兴趣区域标签,我们发现召回率是与放大区域与最终任务性能最密切相关的指标。我们的复制模型和代码可在 https://github.com/UKPLab/emnlp2026-zoom-in 上公开获取