论文

视觉定位解码器需要前馈网络吗?冻结视觉语言特征的对照研究

Do Visual Grounding Decoders Need Feed-Forward Networks? A Controlled Study over Frozen Vision-Language Features

模型评测模型行为与机制分析

摘要

一旦预训练的视觉语言模型已经编码了图像和语言上下文,视觉基础解码器中的前馈网络(FFN)是否会增加必要的计算?我们在冻结的 VLM 特征上比较了四块仅注意解码器 (A4)、匹配的四块注意加 FFN 解码器 (S4) 和八块仅注意参数控制 (A8)。 A4 在 RefCOCOg 和 Ref-Adv-s 上与 S4 匹配或略胜一筹。 FineCops-Ref 显示 A4 在 IoU@0.5 时小幅落后 0.52 个百分点(95% CI [0.12, 0.95] 支持 S4),但 A8 弥补了这一差距,并比 S4 高出 0.26 个百分点。官方的 FineCops 水平并没有显示出差距单调增加。 A4 将可训练解码器参数减少了 44.4%,将缓存解码器延迟减少了 10.1%,尽管端到端延迟仍然是骨干网络主导。这些结果涉及可训练的视觉定位解码器,而不是完整的仅注意 VLM。