论文

使用多模态 LLM 统一声学特征和文本以进行神经退行性疾病筛查

Unifying Acoustic Features and Text with Multimodal LLMs for Neurodegenerative Screening

应用与实践行业应用

摘要

基于语音的筛查提供了一种可扩展且非侵入性的方法来评估阿尔茨海默病 (AD) 和帕金森病 (PD) 等神经退行性疾病,但由于难以整合异构数据,其分期仍然具有挑战性。本文提出了 NeurMLLM,一种用于神经退行性疾病分期的高效多模式生成框架。 NeurMLLM 首先使用视觉 Transformer 对音频数据的频谱图和梅尔频率倒谱系数进行编码,并将其表示投影到 大语言模型 (LLM) 的嵌入空间中,在其中它们与转录本和人口统计指令标记连接为单个统一序列。然后,使用任务提示通过低秩适应对 LLM 进行指令调整,以自回归预测约束标签标记,从而实现生成分类。通过对 Bridge2AI-Voice 数据集进行 AD 和 PD 细粒度分期评估,我们观察到 NeurMLLM 实现了强大的性能,始终优于经典机器学习方法和现有的基于 LLM 的方法。结果表明,多模态 LLM 在神经退行性疾病分期、提高分期准确性并支持可访问部署方面具有巨大潜力。