论文
为什么 MLLM 难以计数:使用 ConvStack 克服个性化和聚合瓶颈
Why MLLMs Struggle to Count: Overcoming Individuation and Aggregation Bottlenecks with ConvStack
摘要
多模态大语言模型 (MLLM) 一直在与细粒度视觉计数作斗争,但其根本原因仍然知之甚少。在这项工作中,我们对这种故障模式进行了机制分析,确定了 MLLM 全局注意力管道固有的两个关键瓶颈。首先,我们揭示了图像补丁化带来的个性化瓶颈:因为视觉变换器独立处理补丁,所以它们很难将跨边界的碎片几何特征分组为不同的对象表示。其次,我们发现了随后的计数聚合过程中的崩溃,其中表示分离随着注意力压缩导致的数量增加而迅速减少。识别并正式确定这些双重瓶颈是我们的第一个重大贡献。为了克服这些问题,我们提出了 ConvStack,这是一种轻量级架构,它直接在视觉词元空间中运行,通过零初始化的残差连接显式聚合和注入局部空间结构。通过明确解决个性化瓶颈,ConvStack 为下游聚合提供了明确的几何证据。值得注意的是,通过专门对计数任务进行微调,该模型在密集对象计数和更广泛的空间理解基准方面实现了实质性改进,而不会影响一般视觉功能。