论文

X-OPD:跨模态 同策略 蒸馏,用于语音能力对齐 LLM

X-OPD: Cross-Modal On-Policy Distillation for Capability Alignment in Speech LLMs

摘要

虽然从级联对话系统到端到端 (E2E) 语音 大语言模型 (LLM) 的转变改善了延迟和副语言建模,但与基于文本的模型相比,E2E 模型通常表现出显着的性能下降。标准监督 微调 (SFT) 和强化学习 (RL) 训练方法未能弥补这一差距。为了解决这个问题,我们提出了 X-OPD,这是一种新颖的跨模式 同策略 蒸馏 框架,旨在系统地将语音 LLM 的功能与其基于文本的对应功能对齐。 X-OPD 使语音 LLM 能够通过 同策略 采样轨迹探索自己的分布,其中基于文本的教师模型评估这些轨迹并提供 词元级 反馈,从而有效地将教师的能力提炼为学生的多模态表示。跨多个基准的大量实验表明,X-OPD 显着缩小了复杂任务中的差距,同时保留了模型的固有功能。