论文
神经形态扩散语言模型:通过稀疏性和块去噪解决计算和内存瓶颈
Neuromorphic Diffusion Language Models: Addressing Compute and Memory Bottlenecks via Sparsity and Block Denoising
摘要
自回归(AR)大语言模型(LLM)在推理时本质上效率低下,因为每个生成的词元都需要访问全套模型参数,导致操作强度低和能耗高。掩码扩散语言模型 (MDLM) 通过允许每次参数访问生成多个词元,部分解决了内存绑定设置的这一限制。为了进一步提高具有大量片内存储器的现代平台上的推理效率,这项工作提出了神经拟态MDLM(N-MDLM),它将块扩散与基于尖峰的神经拟态计算相结合,共同提高吞吐量和能源效率。虽然块扩散通过每次参数访问生成多个词元来增加词元吞吐量,但尖峰引起的稀疏性通过跳过不活动通道来减少有效参数流量和计算。为了分析稀疏性和扩散的协同效应,我们开发了一个受 词元级 屋顶线启发的模型,该模型捕获了块并行生成和尖峰稀疏性对解码效率的综合影响。翻译任务的实验结果表明,由于尖峰引起的稀疏性,即使在 MDLM 无法比 AR-LLM 改进的计算密集型平台中,N-MDLM 也能实现能源效率和吞吐量的显着提高。