论文

TinyAudio:8700万参数的紧凑文本到音频生成

TinyAudio: Compact and Efficient Text-to-Audio Generation for Low-Resource Deployment

模型优化小模型/轻量模型

摘要

文本到音频 (TTA) 生成在生成质量和指令遵循方面取得了快速进步。然而,代表性系统通常需要大约十亿个参数,限制了在资源有限的设备上的部署。本文介绍了 TinyAudio,一种用于低资源部署的紧凑型基于流匹配的 TTA 模型。 TinyAudio的核心使用TA-DiT,一个35M单流流匹配Transformer。 TinyAudio 还包括 TA-CLAP(一种 32M 音频对齐文本编码器)和 TA-VAE(其 20M 解码器从压缩的潜在音频中重建 44.1 kHz 音频)。 TinyAudio 总共只有 87M 个参数,比典型的十亿参数管道少了 90% 以上,并使用 0.48 GB 峰值 GPU 内存。 TinyAudio 在 AudioCaps 和 TTA-Bench 上实现了具有竞争力的生成质量。我们进一步介绍了 TinyAudio-MF,这是一种 MeanFlow 加速模型,可以在四核 CPU 配额下实现实时生成。我们的结果证明了低资源 TTA 部署的实际质量足迹权衡。

AudioCaps上的生成质量与生成器参数量比较;FD越低越好。
图1(图注摘要):AudioCaps上的生成质量与生成器参数量比较;FD越低越好。