论文

自我监督比临床监督更能推动医学基础模型的代表性趋同

Self-supervision drives representational convergence in medical foundation models more than clinical supervision

模型评测模型行为与机制分析

摘要

假设规模和临床监督将其表示集中到共享结构上,来自不同群体的医学图像编码器越来越多地被视为可互换的。这种趋同是否真实、产生它的原因以及它是否在临床上可用都未经测试,而且此类主张背后的相似性衡量标准也很脆弱。我们提出了跨 18 个图像和 7 个文本编码器的受控解剖,所有编码器都是开放权重并在本地运行,涵盖 7M 到 27B 参数和五种成像模式,包括来自六个数据集的 650,982 张胸部 X 光照片。为了隔离原因,我们训练编码器,使其在固定数据、架构和规模下仅改变目标,并在合成模型中重现效果。收敛程度不大,但高于随机下限,由自我监督目标驱动,而不是临床监督:匹配的自我监督编码器对齐最多(胸部 X 光检查为 40.4%),标签监督(21.1%)和图像文本(3.3%)要低得多,并且不随大小(Spearman 0.302,p = 0.223)或能力而增长。它是模态内的,没有达到临床语言,并且没有再现放射科医生如何判断病例相似性。然而,线性分类器跨编码器传输并传输到五家保留的医院,保留了大约 85% 的编码器内性能。因此,医学成像的收敛性是由预训练目标设定的,而不是从规模或临床监督中继承的。因此,互操作性是通过该目标进行设计的,并根据临床判断在患者亚组中验证共享几何结构最薄弱的地方。