论文
饥饿感知:在视觉带宽受限的情况下驯服 VLM 中的惰性感知
Starve to Perceive: Taming Lazy Perception in VLMs with Constrained Visual Bandwidth
摘要
在高分辨率视觉环境中部署为定位代理的视觉语言模型 (VLM) 需要主动感知,即通过缩放、裁剪和平移等操作动态决定查看位置的能力。然而,当前的训练范例产生的模型模仿此类操作的表面形式,而在功能上不依赖于其输出,我们将这种现象称为惰性感知。我们将其追溯到基本的学习不对称性:当粗略的全局视图与语言先验相结合足以达到中等的准确性时,模型没有动力去学习更难的多步视觉搜索。如果一个模型无需主动观察就能成功,那么它永远不会学会观察。这激发了 Starve to Perceive 的诞生,这是一种限制视觉带宽的训练范式——将每次观察限制在严格的 词元预算 范围内,这样单个视图就不足以完成任务,从而使主动感知成为唯一可行的策略。尽管不需要辅助损失、奖励塑造或架构更改(作为对标准 后训练 管道的最小插件修改),但在感知饥饿下训练的模型在不同基准上实现了 5% 平均相对改进的显着收益。