论文
AS$^2$D:加速移动设备上的点播音频理解
AS$^2$D: Accelerating On-Demand Audio Understanding on Mobile Devices
摘要
推测性解码通过使用较小的起草者提出词元以供较大目标进行批量验证来加速自回归生成。然而,传统的推测性解码将起草与目标的不断演变的验证前缀结合起来,序列化起草和验证。我们询问这种依赖性对于源条件生成是否是必要的。我们的主要观察结果是,对于音频语言模型,输入音频和用户请求可以提供有用的推测候选者,而无需遵循目标不断变化的文本前缀。我们提出 AS$^2$D(音频推测推测解码),它可以实现目标解耦起草:音频条件起草者遵循其自己的生成历史,而目标独立验证和纠正准备好的候选者。如果没有可用的候选人,目标将独自前进。因此,目标反馈决定了哪些候选人被提交,但不再决定起草者何时可以取得进展,从而使起草和验证能够同时进行,同时保留目标方的验证和纠正。我们在 Android 版 MNN 中实现了 AS$^2$D,并评估了四部手机、七个数据集和三个涵盖 12.2 小时音频的任务的两个目标模型。在四部手机中,AS$^2$D 比仅目标解码提高了 42-76% 的池 ASR 吞吐量,而只有 5.7% 的评估窗口比仅目标解码慢,而推测基线的速度为 58.1-63.0%。对于 ASR,AS$^2$D 达到事后每个窗口预言机在评估的起草者/预算目录上的汇总吞吐量的 97.33-98.20%。具有 7B 目标的本机按需执行的吞吐量比仅目标高出 78%。这些结果表明,源条件音频生成可以缓解推测性起草对目标不断演变的输出前缀的传统依赖性,从而实现有效推理的大量并行性。