论文
UniAR:以多粒度生成描述补充视觉筛查语义
UniAR: A Unified Framework for Autism Recognition Enhanced by Multi-View Prompt Learning
摘要
自闭症谱系障碍 (ASD) 是一种复杂的神经发育障碍,早期准确的诊断对于改善长期发育结果至关重要。然而,现有的 ASD 识别方法往往受到诊断文本数据稀缺的限制,迫使它们主要依赖视觉分析,并限制了它们对临床有意义的语义推理进行建模的能力。为了应对这一挑战,我们提出了 UniAR,这是一个通过多粒度提示学习增强的统一框架,可在异构数据变化下实现稳健的 ASD 识别。具体来说,UniAR 利用大型多模态模型在单词、短语和句子级别生成分层诊断描述,弥补配对临床报告的缺乏。为了将生成的语义与视觉证据对齐,我们进一步设计了一个基于专家混合的多尺度对齐模块,该模块将矢量量化的视觉原型与相应粒度的语义表示动态匹配。对涵盖大脑 MRI 和面部表情场景的四个基准进行的广泛实验表明,UniAR 始终优于现有的最先进方法,在 MRI 基准上实现了 75.9% 的平均准确度,在面部基准上实现了 91.6% 的平均准确度,同时将 MRI 基准上的平均准确度提高了 1.5 个百分点,在面部基准上的平均准确度比基线提高了 1.2 个百分点。这些结果表明,UniAR 为语义稀缺情况下的 ASD 筛查提供了一个强大且可解释的框架。
