论文

SpikingBrain2.0:用于高效长上下文和跨平台推理的受大脑启发的基础模型

SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference

模型架构混合架构

摘要

扩展上下文长度正在重塑大型模型的开发,但全注意力 Transformer 在长序列上遇到了令人望而却步的计算和推理瓶颈。一个关键的挑战是设计基础模型,以最小的训练开销保持性能和长上下文效率。我们推出了 SpikingBrain2.0 (SpB2.0),这是一个 5B 模型,它提高了其前身的架构和训练效率。我们的贡献是双重的。 (1)架构创新:我们提出了双空间稀疏注意力(DSSA),它是稀疏 Softmax 注意力(MoBA)和稀疏线性注意力(SSE)的层间混合,实现了长上下文建模的性能与效率的改进权衡。 SpB2.0 进一步支持双量化路径:INT8-Spiking 编码可实现稀疏事件驱动计算,而 FP8 编码可加速现代 GPU 上的推理。 (2) 增强训练策略:我们使用精选的开源数据开发了一个优化的 Transformer 到混合 (T2H) 管道,具有 LLM 和 VLM 的双转换路径。根据经验,SpB2.0-5B 和 SpB2.0-VL-5B 在 7k A100 GPU 小时内恢复了大部分基本 Transformer (Qwen3-4B) 功能。 SpB2.0 在 4M 环境下实现了 10.13 倍的 TTFT 加速,并在 vLLM 下支持 8 个 A100 GPU 上超过 10M 的词元,其中全注意力模型超出了内存限制。它还具有强大的跨平台兼容性,可实现 FP8 GPU 推理(在 250k 时加速 2.52 倍)和高效的神经形态执行(稀疏度为 64.31%,在 500MHz 时面积和功耗分别减少 70.6% 和 46.5%)。总体而言,SpikingBrain2.0 为轻量级、多模式、尖峰基础模型提供了一条实用途径,突出了将大脑启发机制与资源受限和边缘场景的高效架构相结合的潜力。