论文
大语言模型可以模仿人类语音进行临床评估吗? LLM 驱动的数据增强用于认知得分预测
Can Large Language Models Imitate Human Speech for Clinical Assessment? LLM-Driven Data Augmentation for Cognitive Score Prediction
摘要
由于数据集大小有限和类别不平衡,准确评估自发言语引起的认知下降仍然具有挑战性。在这项工作中,我们提出了一种 大语言模型 (LLM) 驱动的数据增强框架,以改进语音认知分数的预测。实验是在日语语料库上进行的,其中每个参与者对相同的临床提示提供自发的口头叙述和书面反应。书面回复作为语义锚点,使用 GPT-5 生成不同风格的多个类似口头的独白。然后,我们使用在 Sentence-BERT 语音嵌入上训练的偏最小二乘回归模型来预测长谷川痴呆量表分数,这是日本广泛使用的认知筛查工具。我们研究了两种增强策略:随机类平衡选择,它产生适度但不稳定的改进,以及相似性引导的类平衡选择。后者优先考虑语义接近的合成样本,从而带来更一致的改进,并大幅减少少数低分参与者的预测误差,同时保持大多数群体的表现。总的来说,我们的研究结果证明了语义引导的 LLM 驱动增强作为解决临床语音分析中类别不平衡和提高数据效率的原则方法的潜力。