论文
TS-OPD:通过特定于任务的同策略蒸馏来协调语音语言模型中的 ASR 和 QA
TS-OPD: Reconciling ASR and QA in Speech Language Models via Task-Specific On-Policy Distillation
摘要
语音语言模型 (SLM) 继承了预训练语言模型强大的指令跟踪功能,但 ASR 专业化可能会大大降低它们的性能。为了解决这种 ASR-QA 权衡问题,我们提出了特定于任务的按策略蒸馏 (TS-OPD),它利用 ASR 专业化之前和之后的模型作为补充 QA 和 ASR 教师。学生为 ASR 和 QA 生成单独的任务条件轨迹,每个轨迹仅由相应的教师监督,从而减少两个监督信号之间的直接竞争。对基本 ASR、上下文 ASR 和 QA 的实验表明,TS-OPD 在保留 QA 能力的同时提高了识别能力。此外,TS-OPD 在不同的平衡系数下仍然保持稳健,并继续受益于蒸馏数据的增加。