论文
ViTok:PHI-S与MIM改进AM-RADIO式多教师蒸馏的稠密语义
ViTok: Improving Dense Semantics in AM-RADIO-Style Multi-Teacher Distillation with PHI-S and Masked Image Modelling
摘要
我们研究如何把当前VITOK进展整合为单一多教师蒸馏配方,联合保持全局识别与稠密语义。起点是从SigLIP2与DINOv3-L蒸馏的AM-RADIO式学生:SigLIP2提供强全局语义,DINOv3-L提供更强的稠密特征。核心经验问题是同一配方无法同等优化所有目标——提升ImageNet-1K kNN准确率的改动仍会损害ADE20K分割。我们总结了使这一权衡更明确、更可控的一系列修改:CLS与patch token的分体适配头、非对称cosine/MSE损失、从DINOv3-L检查点初始化、教师重加权、掩码图像建模(MIM)与PHI-S特征平衡。所得模型达到83.2 patch kNN与85.2 CLS kNN,在ImageNet-1K kNN分类上略超DINOv3-L教师,同时PHI-S把ADE20K性能从46.5/58.1恢复到48.5/61.0 mIoU/mAcc,在该稠密基准上追平教师。我们还总结阴性结果:把蒸馏从ImageNet-1K扩展到ImageNet22K并不一致有益,朴素添加SAM3或HOG特征等额外教师会引入干扰。本文不宣称最终配方,而是把项目现状提炼为紧凑的经验故事与供未来迭代的具体系列教训。