论文

DyaFDB:全双工对话模型的双侧交互评测

Conversation Is a Two-Body Problem: Dyadic Evaluation of Full-Duplex Dialogue Models

模型评测评测方法与指标

摘要

全双工语音对话模型可以同时听和说,使语音智能体能够实现回合制系统无法提供的自然、低延迟交互。然而,它们通常是针对单方面的对话者进行评估的:无法做出反应的预先录制的音频,或者是实时反应但只管理固定测试顺序并且从不评分的自动考官。这些单侧框架仅评估二体问题的一半,其中轮流、重叠和中断是两个耦合扬声器的联合产物。我们提出了 DyaFDB,一个在二元设置中评估全双工模型的框架:两个模型在具有合作或冲突目标的指定角色下直接进行对话,并且双方都由外部法官离线评分。 DyaFDB 探针 两个模型如何对待彼此,例如它们如何轮流或在不同的利益下承担分配的角色。我们将四项任务实例化为 140 个场景,并记录 7,560 个对话,涵盖 6 个自我游戏和交叉游戏配对。在整个实验中,我们观察到模型的行为方式不断重塑其伙伴。因此,我们证明每个模型都必须既是另一个模型的审查者又是被审查者,并且没有一个固定的对话者可以同时扮演这两个角色。我们将发布两个全双工模型之间的场景、角色提示和录音协议,没有任何预先录制的音频。

DyaFDB:全双工对话模型的双侧交互评测:论文原图
图 1:全双工模型的评估框架。 (a) 刺激响应:模型对无法做出反应的预先录制的音频做出反应。 (b) 自动化检查员:检查员实时对模型做出反应,但必须要求进行一组测试并且从不评分。 (c) DyaFDB(我们的):两个全双工模型在模型到模型桥上平等地进行通信。每个模型都可以在共享场景中扮演私人角色,并且双方都可以从录音中离线评分。