论文

大型视觉语言模型的双曲线和证据优先专家

Hyperbolic and Evidence-Prioritized Experts for Large Vision-Language Models

摘要

通过规模化架构和广泛的训练,大型视觉语言模型 (LVLM) 在多模式任务上展现了令人印象深刻的性能。最近的研究将专家混合 (MoE) 引入 LVLM 以提高计算效率。然而,现有的教育部方法使用对称架构来处理视觉和语言模态,忽略了这两种模态处理方式固有的不对称性。这种不对称性导致了两个关键问题。首先,文本和视觉形成层次关系而不是并行关系,因为文本查询通常描述完整视觉场景的部分方面。欧几里得专家空间很难对这种遏制结构进行编码。其次,更深层次的语言专家逐渐从基于证据的处理转向参数记忆依赖,失去了所提供的视觉和语言信息的基础。为了解决这些问题,我们提出了 AsyMoE,这是一种新颖的架构,通过三个专门的专家组明确模拟这种不对称性。模态内专家负责模态特定的处理。双曲跨模态专家通过负曲率几何捕获分层跨模态关系。证据优先的语言专家抑制参数记忆激活并在整个网络深度中保持上下文基础。大量实验表明,AsyMoE 比基线方法取得了一致的改进,与 MoE 变体相比,平均增益为 1.5%,在幻觉敏感任务上的平均增益高达 3.8%。与密集模型相比,AsyMoE 激活的参数减少了 25.45%。