论文

提升口语LLM表达:细粒度意图评测与声学—词汇解耦策略优化

Towards More Expressive Spoken LLMs: Fine-Grained Intent Benchmarking and Acoustic-Lexical Decoupled Policy Optimization

模型训练强化学习

摘要

口头情感对话需要一个模型来理解用户的口头输入并生成语义上适当且情感上表达的响应。这是具有挑战性的,因为交际意图可能在词汇内容中明确表达,或者通过副语言线索更隐含地表达,这些线索可以补充或偏离单词本身。然而,有两个限制限制了这一领域的进展:缺乏区分这些意图表达的基准,以及缺乏共同考虑响应质量和情绪表达的强化学习目标。为了解决缺乏合适基准的问题,我们引入了 ParaIntent,这是一个中国基准,包含 14 个意图类别,具有平衡的显性和隐性样本,以及涵盖意图实现、响应质量和情感表达的多维度评估协议。对于策略优化,现有方法要么使用文本和语音的共享目标,要么仅将强化学习应用于一种模态,从而使特定模态的学习信号陷入策略优化中。受此启发,我们提出了声学-词汇解耦策略优化(ALPO),它计算独立的文本和声学优势,并在统一的生成轨迹中将它们路由到相应的文本和语音标记。在相同的奖励函数和训练预算下,ALPO 在大多数自动指标上都比标准 GRPO 有所改进,并在微调变体中实现了最佳主观结果,在合成测试集和人工记录测试集上的情感表达力方面都有特别明显的提升。