论文

SymbolicLight V2:用于低能量语言推理的混合神经形态架构和稀疏执行

SymbolicLight V2: Hybrid Neuromorphic Architecture and Sparse Execution for Low-Energy Language Inference

AI 基础设施模型架构混合架构模型部署

摘要

SymbolicLight V2 将稀疏事件计算与混合神经形态语言架构中的连续状态处理相结合。扩展了 V1 的尖峰门控双路径,它添加了进一步预测的分级签名事件和无 softmax 的局部注意力。我们使用数字定点运算在 Alveo U50C FPGA 上以及使用稀疏整数执行的 ARM CPU 上实现了 194M 参数模型。在 175 MHz 下的三个相同检查点 FPGA 实现中,活动行权重收集和有效状态 KV 加载将 32 个词元前缀和 128 个输出的解码吞吐量从 474.6 个词元/秒提高到 643.2 个词元/秒。每个生成的词元的估计总卡能量从 0.06087 下降到 0.04407 J,减少了 27.6%。三个前缀长度的完整请求能量(包括预填充)下降了 24.4-27.7%。独立的空闲分配将卡总能量的 82.8% 归因于加载空闲,这解释了更短词元延迟的好处。与记录的 RTX 5090 编译 FP32 基准相比,整数 FPGA 执行在短上下文解码期间使用的估计卡能量减少了 89.1%;算术精度不同,GPU 基准也不是最低能耗测试配置。在 ROCK 5T 的四个 Cortex-A76 内核上,适配器交流输入处每个生成词元的功率为 9.80 W,功耗为 0.151 J,完整请求达到 65.4 个词元/秒。这些结果将事件稀疏性与省略的计算和数据移动联系起来。该机制还支持其他专用 V2 实现:以比有功功率更大的系数增加吞吐量会降低每个生成词元的能量。评估固定已部署的检查点;其质量遵循相同预算的密集控制,因此结果并不能建立同等质量的效率。