论文

为每位患者构音障碍 ASR 选择 PEFT 变体:基于两个 ASR 基础的单说话者案例研究

Choosing a PEFT Variant for Per-Patient Dysarthric ASR: A Single-Speaker Case Study on Two ASR Bases

模型评测模型能力评测

摘要

每个患者的适配器是构音障碍自动语音识别 (ASR) 的首选生产架构,但参数高效的 微调 (PEFT) 变体尚未在依赖于说话者的每个患者方案中进行比较。我们提出了一项单说话者案例研究,比较了两个生产基地(带有匈牙利语 微调 的 Whisper-large-v3 和多语言 Qwen3-ASR-1.7B 检查点)上的七种 LoRA 系列方法(LoRA、QLoRA、AdaLoRA、DoRA、LoHA、VeRA、VB-LoRA),针对一名中风后匈牙利男性说话者(S1,409 个话语;严重)听觉感知临床评估中的构音障碍)。注意力投射适配器在这两个方面都显着提高了 CER。在三个种子中,配对引导程序检测到 LoRA-DoRA 没有显着差异(p>0.5;Whisper 上的 CER 为 13.86/13.90%,Qwen3-ASR 上的 CER 为 28.10/28.33%),因此我们采用更简单、更便宜的 LoRA。真正的 4 位 (NF4) QLoRA 在每个种子和两个基础上都更差 (14.56/30.09% CER),在这种规模下没有内存节省,LoHA、VeRA、VB-LoRA 和 AdaLoRA 没有达到 LoRA 系列,尽管 LoHA 在 Whisper 上仍然提供了 18.6% 的相对 CER 降低。在相同的基础上,完整的 微调 更准确(11.43% CER),但也适应前馈块的 115 MB LoRA 可以达到 0.66 pp 以内,大约占每个患者存储的 3.7%。 6 点登记网格显示,大约 5 分钟的患者音频捕获了 45.6% 的零次到 30 分钟 CER 降低,并在 10 和 30 分钟时进一步增加(警告:一名说话者、一种语言、严重的中风后构音障碍)。训练脚本和食谱将在出版时发布,并根据研究使用许可证提供源代码。