CrowdCue:视觉语言人群计数的专家提示调节
CrowdCue: Specialist-Cue Conditioning for Vision-Language Crowd Counting
摘要
生成视觉语言模型 (VLM) 提供了一种计数范式,其中一个模型既生成计数又生成场景的自然语言描述,但其原始计数精度处于亚百万参数专业回归量的范围内。悬而未决的问题是,来自预先培训的专家的辅助指导是否可以将他们提升到有用的领域,以及通过哪个渠道提供最佳指导。 We evaluate Qwen2.5-VL-7B on four widely used crowd counting benchmarks (ShanghaiTech A and B, UCF-QNRF, NWPU-Crowd). Zero-shot prompting rarely produces a parseable count, so LoRA supervised fine-tuning establishes the baseline at overall MAE 81.64.在我们测试的每种编码中,将 P2PNet 派生的密度热图作为辅助视觉信号进行调节都会失败,并且对抗性交换协议显示模型读取了热图,但应用它却适得其反。 We propose CrowdCue, a family that supplies the same specialist's already-integrated integer count to the VLM as a discrete symbol.文本通道变体达到 MAE 72.04。视觉通道变体将整数渲染为打印数字并将其作为第二张图像提供,达到了 MAE 62.65,这是本文中最强的结果,远远领先于单独提供提示的专家(同一部分的 84.45)。在我们研究的后期融合 VLM 中,绑定约束不是通道,而是传递专业信号的抽象级别。