论文
SLT 2026 SmartGlasses 挑战:使用音频语言模型对以自我为中心的多说话者语音识别和理解进行基准测试
The SLT 2026 SmartGlasses Challenge: Benchmarking Egocentric Multi-Talker Speech Recognition and Understanding with Audio-Language Models
摘要
大语言模型 (LLM) 和多模态 LLM (MLLM) 的最新进展为可穿戴语音接口创造了新的机会,智能眼镜为连续音频传感和辅助提供了一个以自我为中心的平台。然而,由于动态声学条件、说话者重叠以及以佩戴者为中心的录音几何结构引入的空间模糊性,这种环境下的语音识别和理解仍然具有挑战性。为了支持这种情况下的系统评估,我们引入了 IEEE SLT 2026 SmartGlasses Challenge,用于以自我为中心的多说话人语音处理。该挑战赛包括二元对话理解和多方会议理解两个赛道,并联合评估时间戳说话人属性自动语音识别(TSA-ASR)和口语理解(SLU)。它建立在一个 106 小时的四通道以自我为中心的语音数据集上,其中包含在现实场景中收集的 714 个会话。本文描述了挑战任务、数据集构建、提交,并总结了共享评估的主要发现。结果表明,严重的说话人重叠仍然是影响 TSA-ASR 性能的主要因素,而对于复杂 SLU 设置中的当前音频语言模型来说,副语言声学理解仍然很困难。更多详细信息可以在官方挑战网站上找到。