论文
ECG:在推理时动态排除指定说话人的语音转写
Inference-Time Target Speaker Unlearning in LLM-Based Automatic Speech Recognition
摘要
我们在一个完全端到端的多说话人 ASR 和说话人分离框架中引入了目标说话人遗忘 ASR (TSU-ASR) 任务。考虑到多说话者的话语和一组不希望转录其语音的选择退出说话者,该任务需要 ASR 系统转录除选择退出之外的所有说话者,同时仍然指示这些说话者何时处于活动状态。作为解决这一任务的第一步,我们引入了一种新颖的、轻量级的注册条件门控(ECG)模块,该模块可连接到冻结的双流语音大语言模型,该模块可以在推理过程中动态处理新的退出转写说话人,即使是那些在初始 ECG 训练阶段没有见过的发言者。我们在 AMI(英语)和 AliMeeting(普通话)数据集上的实验表明,相应选择退出单词或字符的语音转录准确率分别从 72.3% 下降到 48.2% 和从 73.6% 下降到 27.3%,而保留说话者的转录错误率保持大致相同。我们的方法为现代视频会议平台提供了实用的解决方案,允许发言者动态选择退出自动人工智能转录,而无需强行离开会议会话,从而为每天可能进行的数百万次在线会议提供隐私保护界面。