论文

多模态 大语言模型 是否需要推理来根据言语对痴呆症进行分类?

Do Multimodal Large Language Models Need Reasoning to Classify Dementia from Speech?

模型训练参数高效训练

摘要

多模态 大语言模型 (MLLM) 已成为一种有前途的方法,可提高语音记录自动痴呆分类 (ADC) 系统的准确性、可转移性和可解释性。然而,目前尚不清楚它们的推理能力是否对 ADC 有利,以及应如何利用这些能力。在本文中,我们对 ADC 的推理 MLLM 进行了仔细评估,结果表明,与无 LLM 的基线相比,幼稚的策略(例如依赖基于文本的基本原理)可能会导致幻觉和不一致的诊断基本原理,并产生较差的 ADC 性能。为了克服这一限制,我们提出了带有非线性 \textbf{A}daptor 和 Re\textbf{i}nforcement \textbf{L}earning (DeTAiL) 的 \textbf{De}mentia \textbf{T}hinker,这是一种基于适配器的框架,利用推理 MLLM 的内部表示来改进痴呆症分类。在具有不同测试格式和标签粒度的两个痴呆症数据集中,DeTAiL 始终优于依赖于基于文本的基本原理的强大基线和方法。代码和演示将在接受后发布。