论文

CoDeTT:轮流评估的上下文感知决策基准

CoDeTT: A Context-Aware Decision Benchmark for Turn-Taking Evaluation

模型评测基准与评测资源

摘要

轮流建模是语音对话系统的基础,但其评估仍然分散,并且通常仅限于狭窄交互设置下的二元边界检测。此类协议阻碍了对话条件下的系统比较并掩盖了模型的弱点。我们推出了 CoDeTT,一种用于轮流评估的上下文感知决策基准。 CoDeTT 将轮流制定为结构化决策问题,并构建具有细粒度决策类别和受控上下文变化的多场景数据集。在统一的评估协议下,我们评估代表性的现有模型,并观察决策类型和交互场景之间的巨大性能差异。 CoDeTT 为轮流系统的系统性和情境感知评估提供了标准化基准。基准数据集和评估工具包可在 https://yingaowang-casia.github.io/CoDeTT.github.io/ 获取。