论文

将轮流转换与语义解耦:基于有限状态机的全双工对话的解耦数据方法

Decoupling Turn-Taking from Semantics: A Decoupled Data Approach for Finite-State-Machine-Based Full-Duplex Dialogue

模型训练监督微调与指令调优

摘要

神经有限状态机 (NFSM) 框架通过在标准下一个词元预测目标下将轮流控制和响应生成序列化到单个因果磁带上,提供了一条实现全双工对话的实用路径,从而以较低的 微调 成本保留了语义能力。然而,它对合成文本数据的依赖从根本上限制了轮流的自然性,因为 大语言模型 (LLM) 无法忠实地模拟真实人类对话的细粒度声学时间动态。在这项工作中,我们提出了一种解耦的数据方法,该方法从真实的人与人(HH)口语对话中学习轮流,同时通过可配置的人与代理(HA)文本对话塑造语义行为。为了实施这种方法,我们引入了一种基于规则的事件引导数据转换方法,通过对轮流事件进行分类并应用确定性映射规则,将 HH 口语对话序列化为 FSM 磁带,从而无需 LLM 生成的注释即可实现可扩展的监督。我们进一步提出了源感知校准(SAC)损失,它联合校准状态转换词元的长尾分布,并将每个数据源引导至其最佳监督的能力。实验表明,我们的方法显着提高了轮流熟练程度,同时恢复了基础 LLM 的语义能力。我们的代码和模型可在 https://github.com/Liyht/def-fsm 获取。