论文

SpeechDx:临床语音AI的多任务基准

SpeechDx: A Multi-Task Benchmark for Clinical Speech AI

模型评测基准与评测资源

摘要

语音通过同时牵动神经、运动、呼吸与发声系统——提供独特的健康信息窗口。当前临床语音AI方法大多经由孤立的特定条件研究进展——使结果难以比较、泛化难以评估。我们介绍SpeechDx——横跨12个数据集、27个任务、覆盖多样健康状况的大规模临床语音AI基准。为支持跨共享临床机制的评估——SpeechDx按任务干扰的言语产生阶段组织任务:概念化、形式化与发音。该基准以含有限标注数据的任务与跨多数据集评估同一健康状况的方式测试泛化——区分临床有意义的模式与数据集伪影。我们系统评估12个SOTA音频编码器——跨全部任务及零样本跨条件迁移。结果表明:大规模语音模型构成最强总体基线——领域专属模型仅在紧密匹配任务上改进性能——且当前没有任何表示能在临床语音图景上可靠泛化。SpeechDx为追踪通用临床语音表示的进展确立共享评估框架。

SpeechDx:临床语音AI的多任务基准:论文配图
图 2:分类任务的零样本迁移评估。顶部四个网格显示同一类别内任务之间的转移,而底部网格显示平均跨类别表现。每个单元报告最佳模型以及它针对给定任务实现的 AUC。