论文
我会留意:教授音频大语言模型主动音频协助
I'll Keep an Ear Out: Teaching AudioLLMs Proactive Audio Assistance
摘要
音频大语言模型 (AudioLLM) 反应式运行,仅在查询时响应。我们引入了主动式音频辅助,其中 AudioLLM 监控音频流,并自主决定何时通过单一自然语言意图提醒用户,这是由聋哑和听力障碍用户的可穿戴应用程序推动的。我们提出了中断和静默建模(ISM),这是一种与模型无关的范式,通过两个特殊标记将主动决策嵌入到 LLM 解码中:\texttt{<interrupt>} 和 \texttt{<silent>},捕获四种状态:开始检测、持续相关性触发、不相关性抑制和重复数据删除。 ISM应用于Qwen2-Audio-7B,在ESC-50上实现了99.6%的中断F1和完美的重复数据删除调用。在嘈杂的 Epic-Sounds 厨房音频中,ISM 无需特定领域的训练即可实现最高的中断 F1,这是在不过度触发或过度抑制的情况下保持强大的起始检测的唯一方法。流媒体评估确认了实时可行性,平均延迟为 3.5 秒。