论文
使用 LALM 反馈进行偏好优化,用于连续自回归非言语发声生成
Preference Optimization with LALM Feedback for Continuous Autoregressive Non-Verbal Vocalization Generation
摘要
我们提出了一种具有大型音频语言模型(LALM)反馈的偏好优化框架,用于连续自回归语音模型中可控的非语言发声(NVV)生成。为了在没有人类偏好注释的情况下构建偏好数据,我们通过将 NVV 注入的真实转录本与 LLM 生成的语义对齐提示相结合来构建双语提示语料库,执行随机模型采样,并使用 LALM 对候选话语进行排名并形成相同提示的选择-拒绝对。然后,我们采用两阶段优化策略:拒绝采样 微调 (RSFT) 首先使模型适应 LALM 选择的高分样本,然后是锚定流-DPO,它使用话语级流匹配损失来制定成对偏好优化,并保留所选样本流匹配目标作为 SFT 锚。这种设计可以实现 DPO 式的偏好学习,无需明确的序列可能性,同时保留对偏好实现的直接监督。在官方 1,600 句话 NVVSpeech Challenge Track~2 测试集上,我们的方法获得了 \textbf{75.80} (79.39 ZH / 72.21 EN) 的最终 Track2Score,比 VoxCPM2 基线高出 \textbf{+1.84}。这些改进主要是由更高的 NVV 准确度和 NVV 感知效果推动的,同时总体质量保持稳定。