论文
聆听不言而喻的声音:声学对抗攻击的语言模型先验
Hearing the Unspoken: Language Model Priors for Acoustic Adversarial Attacks
摘要
在实时环境中运行的自动语音识别 (ASR) 系统必须在严格的时间限制下处理声音输入,其中转录决策本质上是根据不完整的信息做出的。这种因果约束成为攻击者的信息瓶颈,极大地限制了攻击性能。我们新的语义策略攻击通过实时从 大语言模型 派生的预测上下文来增强对手,从而克服了这种因果限制。我们的实验表明,这种形式的增强可以将语料库级别的单词错误率提高到 35.6%,比当前最先进的流式攻击提高了三倍。最终,这项工作揭示了如何利用常见的低延迟 LLM 工具来系统地颠覆实时 ASR 管道。