论文

MAR:通过模块感知架构精简实现高效大语言模型

MAR: Efficient Large Language Models via Module-aware Architecture Refinement

模型架构混合架构

摘要

大语言模型(LLM)在多样领域表现出色,但由于二次方注意力和密集前馈网络(FFN)运算而能耗高昂。为解决这些问题,我们提出模块感知架构精简(MAR),一个两阶段框架,集成状态空间模型(SSM)实现线性时间序列建模,并应用激活稀疏化降低FFN成本。此外,为缓解脉冲神经网络(SNN)与SSM集成中的低信息密度和时间失配,我们设计了自适应三值多步神经元(ATMN)和脉冲感知双向蒸馏策略(SBDS)。大量实验表明,MAR在资源受限下有效恢复其稠密对应模型的性能,同时大幅降低推理能耗。此外,它优于同规模甚至更大规模的高效模型,凸显了构建高效实用LLM的潜力。

MAR:通过模块感知架构精简实现高效大语言模型
图2:MAR 框架概览。该图展示如何通过两阶段优化过程,将基于稠密注意力的模型转化为稀疏高效的线性序列模型。