论文

GeoStack:VLM 中的准阿贝尔知识组合框架

GeoStack: A Framework for Quasi-Abelian Knowledge Composition in VLMs

模型优化模型合并

摘要

我们解决了视觉语言模型(VLM)中知识组合的挑战,在多个领域或任务中积累专业知识通常会导致灾难性的遗忘。我们引入了 GeoStack(几何堆叠),这是一个模块化框架,允许独立训练的领域专家组成统一的模型。通过对适配器流形施加几何和结构约束,GeoStack 确保保留基础模型的基础知识。此外,我们以数学方式证明了权重折叠属性,无论集成专家的数量有多少,都可以实现恒定时间推理复杂度 ($O(1)$)。多领域适应和类增量学习的实验结果表明,GeoStack 为长期知识组合提供了一种有效的机制,同时显着减轻了灾难性遗忘。代码可在 https://github.com/QuantitativeImagingLaboratory/GeoStack 获取。