论文
当有用的上下文泄露时:域适应 ASR 中的隐私风险
When Helpful Context Leaks: Privacy Risks in Domain-Adapted ASR
摘要
SpeechLLM 越来越多地部署在专业环境中,其中域定制是标准做法:用户在提示中提供包含敏感信息的上下文,对专有录音进行微调,或两者兼而有之。我们识别并系统地调查了此类定制中被忽视的隐私风险:适用于识别特定领域术语的模型可能会从上下文或训练数据中转录出语音相似的单词,即使说出的是不同的单词,从而泄露私人信息。为了评估这种风险,我们提出了一种技术来自动构建此类攻击的基准,并将其应用于测量两种定制机制(提示和 微调)的泄漏率。这两种机制都会导致可测量的泄漏,组合时会加剧。我们评估了提示级缓解策略,并分析了跨定制方法的准确性泄漏权衡,发现没有上下文提示的 微调 提供了最佳平衡。