论文

SamaVaani:印度语言多语言临床 ASR 的审核和消除偏差

SamaVaani: Auditing and Debiasing Multilingual Clinical ASR for Indian Languages

模型评测鲁棒性、公平性与可信度评测

摘要

自动语音识别 (ASR) 越来越多地用于记录临床情况,但其在多语言和人口多样化的印度医疗保健环境中的可靠性仍然很大程度上未知。在这项研究中,我们首先对涵盖卡纳达语、印地语和印度英语的真实精神病学访谈数据进行 ASR 表现的系统审核,比较了八种最先进的模型,包括 IndicWhisper、WhisperLargeV3、Sarvam、GoogleS2T、Gemma3n、OmniLingual、Vaani 和 Gemini。我们的结果揭示了不同模型和语言之间的巨大差异,一些系统在印度英语方面表现出色,但在区域语音方面表现不佳。我们使用各种方法进一步微调两个性能最佳的开源模型,即 Gemma3n 和 OmniLingual。由此,我们发现了与演讲者角色和性别相关的系统性绩效差距,引发了对临床环境中公平部署的担忧,而具有公平意识的 微调 进一步缓解了这种担忧。为此,我们提出了 SamaVaani,这是一种统一的去偏技术,可以同时提高 ASR 性能并提高跨人口群体的公平性。