论文

重新思考单细胞基础模型的类不平衡:跨架构和长尾损失函数的系统基准

Rethinking Class Imbalance for Single-Cell Foundation Models: A Systematic Benchmark Across Architectures and Long-Tail Loss Functions

模型评测鲁棒性、公平性与可信度评测

摘要

在我们的实验中,单细胞基础模型(scGPT、scBERT、Geneformer)实现了高达 97.5% 的细胞类型分类准确度,但这种总体准确度可能掩盖了罕见的、通常与疾病相关的细胞群的系统故障,而长尾损失函数被广泛认为可以解决这些问题。我们提出了跨三种架构和三个数据集(多发性硬化症、Zheng68K、人类胰腺)的六个长尾损失函数(交叉熵、加权CE、类平衡损失、焦点损失、LDAM、logit-调整的softmax)的系统基准,总共162次受控训练运行(3个主干x 3个数据集x 6个损失x 3个种子)。普通交叉熵下的整体准确度、Macro-F1 和稀有类召回之间的差距在所有九个(架构、数据集)设置中是一致的,由数据集结构而不是预训练驱动。稀有类故障本身分为两种具有不同嵌入几何特征的状态,在选择任何损失之前就可见:一些类可以通过正确的损失来恢复,而其他类则保留线性可分离性,但在每个评估的损失和架构下被吸收到不相关类的邻域中。在可恢复的类别中,重新加权的效果是通过类别的绝对训练集大小来预测的,而不是通过其在数据集中的份额或数据集的整体不平衡率来预测。类平衡损失和 LDAM 是所有九种设置中最一致的选择,而 logit 调整则用稀有类精度来换取召回率,而不是同时提高两者。我们的结果提供了可重复使用的基准和基于机制的实用指南,用于将基础模型与不平衡的生物数据相结合。