论文
用于设备上语义音频生成的量化原生运行时
A Quantized Native Runtime for On-Device Semantic Audio Generation
摘要
语义音频应用程序越来越需要在通用及嵌入式硬件上进行可控生成,而不是通过框架密集的数据中心堆栈。我们提出了 \textit{aria},一个无依赖的原生运行时,它在普通 GPU、仅 CPU 的机器和 Raspberry~Pi~5 上运行 Stable Audio~3 (SA3) 的完整文本到音乐管道,底层没有 Python 或深度学习框架。我们的主要贡献是对量化的研究:以较低的数值精度运行模型以适应紧张的内存预算,就地节省内存而不是添加内存。由于运行时拥有每个内部张量,因此它还公开了激活控制,这是一种控制模型生成内容的低成本方法。我们通过三个独立的输出衡量标准(提示遵循、整体音频质量、口味保留)来判断质量成本,每个衡量标准都与随机种子之间的普通变化进行比较。八位精度在大幅削减内存的同时,在任何测量中都没有显示出可测量的质量损失,并且它是 GPU 上最快的模式;四位增加了一个小的、有限的成本,但缩小了占用空间,足以在 8 GB 的 Pi 上运行 12亿参数模型。与官方实现相比,aria 匹配或超过生成速度,启动速度大约快七倍。转向界面的案例研究生成带有味道关联的音乐(\emph{声音调味}),对属性子集进行真正但有限的控制。这些结果使得具有内置控制的紧凑、量化运行时成为音联网设置中设备上语义音频的实用基础。 \textit{aria} 运行时在 https://github.com/matteospanio/aria 发布。