论文
FlexiSLM:具有动态且可控帧速率的口语模型
FlexiSLM: A Spoken Language Model with Dynamic and Controllable Frame Rates
摘要
口语模型 (SLM) 将 LLM 扩展到语音输入和输出,但现有系统使用固定帧速率(例如 25 或 12.5 Hz),忽略了语音随时间变化的信息密度并限制了推理时间质量与速度的权衡。最近的动态帧率音频分词器可实现非常低的平均帧率和可控性,但尚未应用于 SLM。我们推出 FlexiSLM,这是第一个具有动态、可控帧速率的 SLM,使用预训练的 FlexiCodec 来实现动态语音输出词元。它将这种表示集成到多任务语音到语音 SLM 中,通过输入侧帧压缩对其进行扩展,并添加直接帧速率调节以在推理过程中进行精确控制。 FlexiSLM 在 12.5 和 6.25 Hz 下的性能优于固定帧率 7B 模型,包括 Qwen2.5-Omni 和 Kimi-Audio;它可以降低至 4.0 Hz,并且在 6.25 Hz 时,相对于 12.5 Hz,推理时间大约减半,同时保持强大的语音到语音质量。音频样本:https://flexislm.github.io;代码和数据:https://github.com/AmphionTeam/FlexiSLM。