论文
相同的位宽,不同的结果:跨架构的文本到语音的训练后量化
Same Bit Width, Different Outcomes: Post-Training Quantization of Text-to-Speech Across Architectures
摘要
训练后量化 (PTQ) 降低了设备上文本转语音 (TTS) 的成本,但已发布的评估涵盖一种系统或方法。我们在一种协议下评估跨 TTS 架构的 PTQ,该协议具有三个核心模型、另外八个模型的权重和激活消融以及两个盲量化的保留模型。每通道四位权重使 UTMOS(预测平均意见得分)在 Supertonic 上降低了 2.8,在 Kokoro 上降低了 0.07,而且即使在 8 位下,每张量缩放也会导致严重的性能下降。相同的位宽度会产生不同的结果,因为敏感组件是特定于模型的,并且不能从模型类可靠地预测。分阶段的烧蚀过程可以识别它,并且每层 GPTQ 可以将其恢复到 0.1 UTMOS 以内。真正的 int8 和 int4 内核以依赖于硬件的成本重现模拟排序。在 Mac mini 上,4 位权重内核以 0.60 倍的 fp32 延迟运行 Supertonic,而 int8 速度较慢,因此每个配置都需要在目标运行时进行验证。