论文

从语音到交互:分析鸡尾酒会场景中的多模态系统

From Speech to Interaction: Analyzing Multimodal Systems in Cocktail-Party Scenarios

模型评测模型能力评测

摘要

人类具有非凡的能力,可以参与自发的非正式对话,并有选择地关注个别发言者,同时从附近的对话中过滤掉竞争性言论。这种“鸡尾酒会”场景仍然对语音识别系统提出了严峻的挑战。 CHiME-9 MCoRec 任务提供了一个测试平台,系统必须在其中识别说话者组并根据视听输入转录他们的每个对话。在这项工作中,我们分析了一组不同的系统,代表了解决鸡尾酒会场景的不同设计方向,其中最好的系统可实现高达 57% 的相对误差减少。我们确定了三种主要策略:(1)显式或隐式视听目标语音分离,(2)改进每个目标说话人的视听语音识别,以及(3)使用 大语言模型 将说话人分组到对话中并增强对话一致性。我们的分析表明,这些方向解决了鸡尾酒会问题的互补故障模式,并且单独的高语音重叠并不能解释性能差异,挑战了重叠是鸡尾酒会识别困难的主要来源的常见假设。