超越 Argmax:用于广义少样本 3D 分割的冻结基础模型组合中语义保留的机制研究
Beyond Argmax: A Mechanistic Study of Semantic Retention in Frozen Foundation-Model Composition for Generalized Few-Shot 3D Segmentation
摘要
经典的分类器组合工作将分数级融合与硬决策级投票区分开来。我们重新审视这种区别,其中独立预训练的冻结基础模型是在推理时组成的,用于广义的少样本 3D 分割。我们问:当异构源在交互之前被折叠为单个类时,会丢失多少有用的语义信息?我们用相同输入的语义保留干预来回答。密集 RegionPLC 和稀疏交叉视图 SAM3 证据、模型权重、掩模、几何形状、词汇和融合规则被冻结;只有在交互之前保留的语义选择的数量通过匹配的 top-k 梯子改变。在 156 个保留的 ScanNet200 场景中,top-1 达到 28.47 调和平均 (HM) IoU,而完全分布融合达到 34.87 HM(+6.40,95% CI [+5.24,+7.64])。该模式在 50 个 ScanNet++ 场景上复制:23.02 vs. 26.50 HM(+3.48,95% CI [+1.64,+5.93])。结论是稳健的:全分布 HM 在稀疏源权重 0.3--0.7 范围内保持稳定;替代算子(max、几何池)也优于 top-1; GroundingDINO--SAM2.1 源替换诊断显示 HM 单调从 14.77 增加到 18.75,并完全保留。校准诊断揭示了两个源的相反错误校准,但纠正校准并不能消除保留优势。在数据集和源堆栈中,大多数信息是通过保留一组紧凑的合理替代方案来恢复的。其贡献是对过早语义崩溃的受控诊断,作为异构冻结模型组合中的可重复信息瓶颈。