论文

大型视觉语言模型的拓扑感知层修剪

Topology-Aware Layer Pruning for Large Vision-Language Models

摘要

大语言模型 (LLM) 在自然语言理解和推理方面表现出了强大的能力,而最近结合视觉输入的扩展使它们能够处理多模态信息。尽管取得了这些进步,大型视觉语言模型 (LVLM) 仍会产生大量计算和内存成本,阻碍了在资源受限场景中的部署。现有的层修剪方法通常依赖于局部相似性度量或静态代理信号,无法捕获跨模型深度的表示的全局和动态演化,这通常会导致删除关键转换层。为了解决这个限制,我们提出了一种用于 LVLM 的拓扑感知层修剪框架。具体来说,我们将逐层隐藏状态表示为点云,并使用 \textit{单纯复合体} 对其演化进行建模。通过利用 \textit{zigzag 持久同源性},我们量化层间拓扑一致性并实现自适应修剪,以保留关键的表示转换。对不同多模态基准的广泛实验表明,所提出的框架在各种稀疏率下始终优于现有的剪枝方法。我们的代码可在 https://github.com/zpc456/TopoVLM 获取。