相同的编码器,不同的获胜者:用于细胞绘制编码器评估的配对视图框架
Same Encoder, Different Winner: A Paired-View Framework for Cell Painting Encoder Evaluation
摘要
用于细胞绘画的视觉编码器通常通过单一评估进行排名,通常是重复平均精度 (mAP)。我们引入了 CP-BG-Bench,这是一种配对视图评估框架,可将中央单元固定在四个匹配视图(原始作物 C、分段 S 以及密度增强变体 CD 和 SD)上,消融或增强周围像素作为受控干预。在四个社区标准协议(复制 mAP、scIB 批量集成、CellProfiler 特征预测、跨批次扰动召回)下,在三个数据集(JUMP-CP、RxRx1、RxRx3-core)和三个编码器(DINOv3 ViT-B/16、OpenPhenom、SubCell)上实例化框架,我们发现这四个协议对相同编码器的系统排名不同,分歧沿三个轴分解:细胞与背景、形态与背景、研究内与跨批次。最大的影响:在 RxRx3-core 上,具有分段输入的 SubCell 保留了 94% 的作物复制 mAP,但仅保留了 32% 的作物 R@10,因此在分段下保留的研究内信号很大程度上是不可转移的;密度增强恢复了 84% 的研究内 C-S 差距,但仅恢复了 8% 的跨批次差距。分段视图在三个数据集中的两个上预测 CellProfiler 特征以及或优于裁剪,从而反转复制 mAP 排名,并且 C 到 S 差距在数据集之间变化一个数量级,同时在编码器之间保持相似,这表明背景驱动的增益是由实验设计而不是编码器设置的。因此,细胞绘画编码器的单度量排名对所使用的协议很敏感,并且协议分歧可以解释为成对视图设计暴露的三个轴上的投影。我们将发布配对视图数据集、重建管道、36 个经过训练的检查点、聚合嵌入和完整的评估套件。