XTurnix:通过两种状态二元决策进行大规模自监督转弯控制
XTurnix: Large-Scale Self-Supervised Turn Control through Two-State Binary Decisions
摘要
实时对话系统中的一般轮流行为需要决定是继续听还是在听时开始响应,以及在说话时是继续还是停止。现有的转弯检测器使用异构的、特定于任务的标签空间,并且通常在有限的注释上进行训练或在孤立的话语上进行评估,这使得它们很难用作具有全面上下文的统一因果控制器。我们提出了 XTurnix,一种紧凑的基于文本的模型,它将转弯控制制定为以人工智能当前的听力或说话状态为条件的两个二元决策,并从完整的对话历史中预测单个控制token。 XTurnix 对 550 万个因果动作示例进行了预训练,这些因果动作示例自动从带有时间戳的两个说话者转录本中派生出来,然后对合成的多轮示例进行微调,使其在四个状态动作标签上分布更平坦。我们根据四个公共基准和一个平衡的自我策划基准来评估 XTurnix。在所有公共基准测试中,XTurnix 在所有 SemanticVAD 和 LiveKit 拆分中均取得了最佳结果,在 Smart-Turn Bench 上与原生 Smart-Turn 模型并驾齐驱,并在 Easy-Turn 上实现了最高的不完全转弯精度。在自行策划的基准测试中,它的准确率达到 89.06%,比最强的第三方基准(68.75%)高出 20 个百分点以上,同时所有四个类别的 F1 分数都保持在 84.21% 到 90.63% 之间。这些结果证明了在单个紧凑模型中统一的听和说状态转向控制。代码可在 https://github.com/xcc-zach/xturnix, 获取,交互式演示在 https://huggingface.co/spaces/xcczach/xturnix-demo.
