论文
多模态 大语言模型 是否需要推理来根据言语对痴呆症进行分类?
Do Multimodal Large Language Models Need Reasoning to Classify Dementia from Speech?
摘要
多模态 大语言模型 (MLLM) 已成为一种有前途的方法,可提高语音记录自动痴呆分类 (ADC) 系统的准确性、可转移性和可解释性。然而,目前尚不清楚它们的推理能力是否对 ADC 有利,以及应如何利用这些能力。在本文中,我们对 ADC 的推理 MLLM 进行了仔细评估,结果表明,与无 LLM 的基线相比,幼稚的策略(例如依赖基于文本的基本原理)可能会导致幻觉和不一致的诊断基本原理,并产生较差的 ADC 性能。为了克服这一限制,我们提出了带有非线性 \textbf{A}daptor 和 Re\textbf{i}nforcement \textbf{L}earning (DeTAiL) 的 \textbf{De}mentia \textbf{T}hinker,这是一种基于适配器的框架,利用推理 MLLM 的内部表示来改进痴呆症分类。在具有不同测试格式和标签粒度的两个痴呆症数据集中,DeTAiL 始终优于依赖于基于文本的基本原理的强大基线和方法。代码和演示将在接受后发布。