论文
人还是机器?面向语音到语音交互的初步图灵测试
Human or Machine? A Preliminary Turing Test for Speech-to-Speech Interaction
摘要
类人对话智能体的追求长期以来以图灵测试为指引。对于现代语音到语音(S2S)系统而言,一个关键却悬而未决的问题是它们能否像人类一样对话。为解答这一问题,我们开展了针对S2S系统的首次图灵测试,在9个最先进S2S系统与28名人类参与者之间的对话上收集了2,968个人类判断。我们的结果给出一个明确发现:没有任何受评估的现有S2S系统通过该测试,揭示了类人程度上的显著差距。为诊断这一失败,我们构建了包含18个类人度维度的细粒度分类体系,并对收集的对话进行了相应的人群标注。我们的分析表明,瓶颈不在语义理解,而是源自副语言特征、情绪表达力和对话人设。此外,我们发现现成的AI模型作为图灵测试评判者表现不可靠。为此,我们提出一个可解释模型,利用细粒度类人度评分,实现准确且透明的人机判别,为自动类人度评估提供了有力工具。我们的工作建立了首个面向S2S系统的类人度评估,超越二元结果、提供细致的诊断洞察,为对话AI系统的类人化改进铺平道路。
