论文
对齐、集成和触发:零样本语音LLM 的高效标记级对齐
Align, Integrate, and Fire: Efficient Token-Level Alignment for Zero-Shot SpeechLLMs
摘要
虽然大型语言模型在自然语言处理方面表现出色,但有效地将其功能扩展到语音输入仍然是一个重大挑战。构建 SpeechLLM 的现有方法通常依赖于计算成本高昂的全模型微调,或者采用参数高效的投影仪,但这些投影仪受到低效词元序列长度和昂贵的全模型监督的影响。在本文中,我们介绍了 Aligned Continuous Integrate-and-Fire,这是一种用于零样本语音处理的高效框架。我们的方法利用显式动态时间扭曲对齐将连续声学帧动态压缩为目标文本的精确离散标记长度。这使得我们的初始训练阶段能够使用轻量级距离度量建立强大的声学到语义桥梁,完全绕过计算成本高昂的 LLM 前向传递。对于后续的微调,我们提出了一个内存高效的知识蒸馏目标,该目标针对单个 LLM 层,以极低的计算成本与全模型交叉熵训练相媲美。通过对自动语音识别和语音翻译的广泛评估,我们证明,与之前的参数高效基线相比,我们的方法实现了卓越的性能。