论文
Tensix 架构上 LLM 推理的算子融合
Operator Fusion for LLM Inference on the Tensix Architecture
摘要
本研究解决了 Tenstorrent Tensix 架构上 Transformer 模型的设备端推理瓶颈,并提出了一种增强数据局部性的算子融合策略。 RMSNorm 与自注意力和 FFN 中的矩阵乘法融合,支持片上 SRAM 中内存限制和计算限制运算符的背靠背执行,从而显着减少 DRAM 中间结果的读/写和调度开销。为了支持多核并行性,利用基于 NoC 的多播机制,其中行/列主节点有效地跨核心网格分配输入和权重,从而缓解 DRAM 带宽争用。在 Wormhole 平台上使用 Qwen2.5-0.5B、Qwen3-0.6B 和 Qwen3-4B 进行的实验表明,注意力延迟降低了 37.44%,MLP 延迟降低了 15.89%,每个解码器层延迟降低了 7.91%,而皮尔逊相关系数 (PCC) 保持在 98.75% 以上,证实了在数值一致性下端到端效率的显着提升。