论文

重写 TTS 推理经济学:Tenstorrent 上的 Lightning V2 成本比 NVIDIA L40S 低 4 倍

Rewriting TTS Inference Economics: Lightning V2 on Tenstorrent Achieves 4x Lower Cost Than NVIDIA L40S

AI 基础设施模型部署

摘要

文本转语音 (TTS) 模型在数值上比 大语言模型 (LLM) 更脆弱,因为它们具有连续的波形生成以及对小数值扰动的感知敏感性。虽然 BlockFloat8 (BFP8) 和低保真 (LoFi) 计算等激进的精度降低技术已在语言模型中广泛采用,但将类似的策略应用于 TTS 系统通常会导致听觉伪影、相位不稳定和频谱失真。在这项工作中,我们展示了 Lightning V2,这是一种针对 Tenstorrent 硬件进行联合优化的生产级 TTS 模型。通过精确感知的架构设计和硬件软件协同优化,我们实现了超过 95% 的 LoFi 计算保真度和超过 80% 的 BlockFloat8 部署,而音频质量没有明显下降。利用 Tenstorrent 的片上网络 (NoC)、分布式 SRAM 和确定性执行模型,我们减少了内存移动和冗余权重获取,从而实现高效的低精度推理。与 NVIDIA L40S 基准相比,Lightning V2 在同等吞吐量下实现了约 4 倍的本地加速器成本降低,同时保持了生产音频保真度。我们的结果表明,精密协同设计与硬件感知优化相结合,可以从根本上重塑实时语音推理的经济性。