论文

FADA:使用选择性提炼的统一视觉语言模型进行无障碍胎儿超声解释和注释

FADA: Accessible fetal ultrasound interpretation and annotation with a selectively distilled unified vision-language model

摘要

全球训练有素的超声检查人员短缺限制了低收入和中等收入国家的产前超声检查,这些国家一半以上的孕妇没有接受过熟练的超声检查。当前的深度学习方法单独解决检测、分割或分类问题,每种方法都需要单独的模型和专家指定的推理标签。我们提出了 FADA,这是一种基于 Qwen3.5-VL 构建的统一视觉语言模型,可通过单个解释优先管道执行临床解释、分类、检测和分割,无需外部标签。 FADA 通过离线预先计算的特征缓存从四个特定领域的基础模型(FetalCLIP、UltraSAM、USF-MAE、UltraFedFM)中提取知识。选择性 蒸馏 仅将特征对齐应用于注释任务,而解释依赖于标准 微调,在大多数评估轴上始终优于完整的 蒸馏。推荐的变体 FADA-SKD 在分割方面达到 0.8820 平均 Dice,在检测方面达到 0.7671 mAP@0.50,并实现 100% 结构化解释合规性。专家超声医师对 237 张图像进行验证,确认了自主模式和人机循环模式下临床可接受的输出,其中 73.5% 的解释在临床医生指导下得分完美。该系统可在单个消费级 GPU 上进行训练,并且无需云连接即可部署。我们通过使用 llama.cpp 和 GGUF 量化在商用智能手机(Qualcomm Snapdragon 7 Gen 1、12 GB RAM)上运行压缩的 0.8B 模型来验证边缘部署,在大约 60 秒内完全离线完成完整的 5 阶段管道。这为将人工智能辅助胎儿评估与便携式超声设备相结合建立了一条实用途径,直接解决资源有限环境中的诊断访问缺口。代码、模型和数据可在 https://github.com/mahmoodphd/FADA 获取。