论文

自监督视觉 同策略 蒸馏

Self-Supervised Visual On-Policy Distillation

摘要

Visual 同策略 蒸馏 在很大程度上依赖于信息丰富的师生不对称,通过更大、更强的教师或特权监督,例如参考答案或 真值 感兴趣的区域。这就提出了一个基本问题:当没有任何特权可用时,信息不对称从何而来?我们通过反转不对称性的来源来回答这个问题。我们不是向老师添加特权信息,而是从学生那里减去信息。这种不对称性免费创建了与教师相同的有效学习信号,可以访问学生无法获得的信息,而无需 真值 注释、奖励或单独的更强的教师模型。在此原则的基础上,我们引入了自监督视觉 同策略 蒸馏 (S$^2$VOPD),这是一种简单而有效的方法,可以从非对称增强视图构造 同策略 学习信号。 S$^2$VOPD 将以原始图像 同策略 为条件的教师分布提炼为以同一图像的强增强视图为条件的学生分布。我们系统地探索了视觉增强的广阔设计空间,并发现(1)不对称性很重要:所有四个增强系列都提高了性能,而对称的自 蒸馏 却降低了性能; (2) 强度很重要:中等强度时表现达到峰值; (3)差距必须保持任务一致:完全消除与问题相关的证据的增强可能会导致巨大但无信息的差异。在六个细粒度感知基准中,S$^2$VOPD 将 Qwen3.5-4B 从 70.7% 提高到 77.4%,高于所有开源模型,最高达到 Qwen3-VL 的 235B,并超过 GPT-5.4。在保持训练数据相同的情况下,它恢复了使用特权信息的方法所实现的 96% 的改进。网站位于 https://williamium3000.github.io/s2vopd