论文
视觉语言模型基准的分层压缩
Hierarchical Compression of Vision-Language Model Benchmarks
摘要
随着基准测试涵盖的功能范围越来越广,并且新模型不断涌现,对视觉语言模型 (VLM) 的彻底评估变得异常昂贵。对于语言模型来说,以一小部分成本保留模型排名的基准压缩方法已经得到了很好的研究,但对于 VLM 来说,这个问题仍然没有得到充分探索。我们提出了 PRIMEBench(多模态评估的修剪冗余项),这是一种视觉感知的分层基准压缩框架,可在保持模型排名的同时大幅降低评估成本。该分层框架分四个阶段运行:数据清理,以删除无需图像和完全正确的项目即可回答的项目;类别代表选择,为每个功能类别选择一个基准;使用视觉感知方差 (VAW) 进行项目修剪,以及类别计数修剪。 VAW 将模型间方差与仅根据多模态嵌入计算的视觉依赖性得分相结合,同时鼓励覆盖每个基准中的不同项目。在项目选择中保留的模型上,它在发布的 5% 保留率下具有最高的平均保真度。分层设计让从业者可以在任何阶段停止以匹配他们的计算预算;发布的套件删除了超过 97% 的项目,同时保留了模型排名。除了压缩之外,我们的分析还展示了 VLM 评估如何随着模型面板的增长和发展而表现,为设计未来的基准提供指导,这些基准更高效、对模型更替更稳健,并且明确了评估端修剪的限制。