论文
AP-GRPO:锚定门控语音对齐与病理语音重建的策略优化
AP-GRPO: Anchor-Gated Phonetic Alignment with Policy Optimization for Pathological Speech Reconstruction
摘要
患有神经退行性和神经运动障碍的患者的病理性言语通常在声学上是扭曲的并且语言上是支离破碎的,因此需要进行病理性言语重建以从扭曲和不完整的言语记录中恢复预期的文本内容。至关重要的是,此类录音很少会被一致降级:某些单词或短语仍然可靠,并且可以作为重建损坏的周围内容的声音锚点。我们引入了锚门控语音组相对策略优化(AP-GRPO),这是一种具有语音奖励的 GRPO 框架,它通过可听锚点保留和锚点间语音兼容性与原始语音信号来对齐语音语言模型(SLM)。 AP-GRPO 包括:(i) 锚定门控奖励,与清晰区域中可靠的可听锚定相匹配; (ii)锚间语音对齐奖励,用于评估恢复的内容是否得到相应损坏的锚间语音跨度的语音支持。在四种疾病状况下,AP-GRPO 改善了忠实的语音重建,并且学习到的锚点约束会自动适应每种状况,从而揭示可解释的疾病特异性概况:严重发音退化的状况需要更强的锚点执行,而较轻微的损伤或语言障碍的状况更多地依赖于语音对齐来实现锚点间的恢复。