论文

VLM为什么漏掉小物体,何时可以安全放大?

Why VLMs Miss Small Objects, and When Zooming In Is Safe

模型评测上下文与知识应用与实践上下文工程模型行为与机制分析通用理解与问答

摘要

视觉语言模型 (VLM) 经常会错过大图像中的小物体。我们问三个问题:什么限制了它们,更好的模型可以消除哪些限制,以及处理大图像的经典方法(局部分解)是否仍然有未来。我们用基于图像界面的两个量的理论来回答这些问题:S,对象侧面的视觉标记的数量,以及 L,调用必须覆盖的内容。限制:在 N 个Token内完整发送的宽 x 高图像给出一个边 m 的对象,每边最多 m*sqrt(N/(WH)) 个Token。因此,将Token预算 N 加倍,整个图像所能达到的最大 S 仅提高了 41%,并且无论模型如何,在 S 处查看对象所需的图像至少需要花费 S^2 个Token。如果通过 S 识别能力逐渐提高,则任何搜索策略(包括缩放Agent)都遵循召回成本边界。更好的模型可以改变什么:一个对象需要的 S 以及一个调用可以携带多少,以找到的每个对象的位数来衡量;承保费用仍然存在。分解:是的。假设每个对象更多的Token和每次调用更少的内容平均而言不会造成伤害,如果没有视图相对于整个图像缩小并且视图与一个对象重叠,则分割图像不会降低召回率。此条件的任何一部分都不能被删除;我们限制了每次此类分解的成本,并且随着图像的增长,一个简单的规则接近该界限。我们在 797 张图像上的约 177,000 个请求中测试了该理论。在受控图像上,8 个 VLM 预测的 40 个顺序均未被违反。事后对图纸、平面图、自然图像和合成图像进行检查,89 个隐含顺序中有 61 个显着成立,4 个失败,所有这些都是针对 OpenAI 模型给出的像素多于默认路径的情况。在施工图上,该规则从未显着降低相对于整个图像的召回率,并将召回率提高了 0.28。代码和数据:https://github.com/shijunzhe/vlm-small-objects

VLM为什么漏掉小物体,何时可以安全放大?:论文原图
图 6:(a) 在 14 张整张纸上进行严格的 F1,自始至终都采用相同的中等难度推理。从左到右,每个条形改变一个步骤:一次整体绘图调用;缩放代理,其工具返回以概览比例从概览中剪切的请求区域(仅限较低的 LL);相同的作物扩大到本地作物的大小(SS也更高,没有新信息);本土作物(也是新信息);以及供参考的特定于型号的图块。代理栏平均运行两次,概览裁剪栏平均运行一次。灰色带:模板匹配。 (b) GPT-5.6 在一张纸上(橙色)根据其收到的概览选择了 20 个缩放区域;蓝点是带注释的实例。