论文
GRAFT:持续教师蒸馏生长聚合基础模型
GRAFT: Growing Agglomerative Foundation Models via Continual Teacher Distillation
摘要
DINOv2、SigLIP2与MASt3R等视觉基础模型从不同预训练目标发展出互补能力,但其知识分散在各自专门模型中。多教师知识蒸馏为把这些能力整合进单一聚合骨干提供路径,但现有方法假设教师集固定,纳入新教师需对整个教师集重复昂贵的联合蒸馏。我们提出GRAFT,一个持续多教师蒸馏框架,使统一骨干能从开放的基础模型序列渐进获取能力:新教师到来时,GRAFT把先前蒸馏模型当作保留已学能力的教师,当前学生同时从先前模型与新教师学习。为调和异构教师不相容的表示几何,我们提出教师特定读出token(为每位教师提供共享编码器的独立读出)与几何无关关系损失(通过匹配图文相似结构而非原始特征值来对齐视觉-语言教师)。我们提供GRAFT模型——单一可持续扩展的骨干,统一图像理解、2D稠密预测、3D人体姿态估计、3D视觉与视觉语言五个领域,在全部领域表现强劲,且每项新能力的获取只需一次蒸馏而非完整再蒸馏。