论文

沉默和重叠都不是失败:全双工口语对话模型中轮流的意图条件评估

Neither Silence nor Overlap Is Failure: Intent-Conditioned Evaluation of Turn-Taking in Full-Duplex Spoken Dialogue Models

模型评测评测方法与指标

摘要

全双工口语对话模型的基准通过二进制固定窗口规则对轮流进行评分,该规则根据前轮的完成情况奖励立即响应或沉默。我们认为,响应抵消的适当性,无论是延迟沉默还是预期重叠,都取决于说话者的潜在意图,而只能从说话者的行为中识别出来。我们引入了 TACT,这是来自五个二元语料库的 9,728 集和 73.2 小时的基准;每个情节都包含对话历史记录、每个说话者的记忆概况以及六个意图类别的注释器派生后验。评分用严格正确的阈值加权连续排名概率得分代替二进制窗口,其权重是适合人类地板传输偏移分布的意图条件定时内核,证明有界性、一致性和二进制缩减。在 11 个系统中,最佳模型达到 0.47,而人类顶线为 0.86,几乎不受说话者配置文件的影响,并且 TACT 与 Spearman 0.81 与二进制指标 0.46 的人类判断一致。