论文
连接模型的想法和说话方式:通过自我意识意图实现对齐生成富有表现力的语音
Bridging What the Model Thinks and How It Speaks: Expressive Speech Generation via Self-Aware Intent-Realization Alignment
摘要
语音语言模型 (SLM) 表现出强大的语义理解能力,但往往无法将这种能力转化为富有表现力的声学实现,产生韵律扁平且情感错位的语音。我们将这种不匹配视为语义理解与声学实现的差距。现有的方法通常依赖于外部指定的代理,例如情感标签或风格提示,它们需要注释,并且很难捕获整个对话中动态变化的表达意图。为了克服这些限制,我们提出了SASLM(自我感知语音语言模型),这是一种无代理框架,通过自我意识意图实现对齐来桥接模型的思考内容和说话方式:(1)意图感知桥接通过变分信息瓶颈(VIB)从模型自身不断演变的语义生成状态中自我提取表达意图,从而在没有外部表达监督的情况下指导表达语音实现; (2)实现感知对齐通过自我奖励优化,反射性地将生成的声学与预期表达对齐,逐步提高语音生成过程中意图实现的一致性。尽管仅使用 3B 参数和 800 小时的表达语音数据,SASLM 在开源系统中的 EchoMind 上实现了最先进的性能,超越了 10 倍以上的模型,接近商业系统。