论文

具有自适应焦点损失的视觉基础模型的参数高效快速调整,用于可解释的 MCI 筛查

Parameter-efficient Prompt Tuning of Vision Foundation Model With Adaptive Focal Loss for Interpretable MCI Screening

模型训练参数高效训练

摘要

轻度认知障碍是认知能力下降的关键早期阶段,通常先于阿尔茨海默病,但神经心理学绘图测试的自动检测仍然从根本上受到数据稀缺、类别不平衡和接近临床边界的诊断模糊性的限制。现有的方法试图使用计算成本昂贵、完全微调的混合架构来绕过这些限制,这些架构将空间可解释性降级为事后近似而不是内在模型属性。我们提出了一个参数高效的框架,利用冻结的 DINOv2-Small 模型,通过三个特定于模态的可学习提示标记进行调整,同时使用 119 万个可训练参数进行操作,每个标记充当源图像补丁标记上共享交叉注意层中的查询。至关重要的是,空间可解释性是通过这些注意力图直接实现的;作为建筑的结构结果。然后,通过注意力模块融合任务条件嵌入,以量化每个主题的模态级别重要性。为了处理边界模糊性,引入了 MoCA 适应的焦点损失,它将连续认知分数集成到训练目标、损失调制和自适应样本权重中,严格概括标准软标签方法。在分层五重交叉验证下,所提出的架构产生了 0.641 的 MCI 级 F1 和 0.795 的 AUC,在 MCI 级 F1 中比计算量更大的 ResViT 基线高出 0.110。