论文

用于茶叶病害分类的从视觉基础模型到轻量级视觉状态空间模型的跨架构 知识蒸馏

Cross-Architecture Knowledge Distillation from a Vision Foundation Model to a Lightweight Visual State Space Model for Tea Leaf Disease Classification

摘要

自动化茶叶病害分类支持精准农业,但在计算预算紧张的情况下,在边缘设备上部署准确的模型仍然具有挑战性。 DINOv2 等自监督视觉基础模型提供了强大的功能,但对于现场部署来说太大,而在小型农业数据集上从头开始训练的轻量级模型通常不适合。我们研究跨架构 知识蒸馏 (KD),从微调的 DINOv2 教师 (Vision Transformer) 到紧凑的双向视觉状态空间模型 (LVSSM) 学生,这是一个尚未充分探索的方向,因为这些架构使用根本不同的词元混合机制。我们识别并修复了两个训练稳定性问题,这些问题阻止了从头开始的 SSM 学生在有限数据上学习:单个大补丁嵌入卷积和切断残差路径的融合层。借助渐进式卷积干和门控双向选择性扫描块,4.45M 参数的学生训练稳定。在三个种子中,温度缩放的 logits 蒸馏 将测试精度从 92.32+/-2.14% 提高到 95.41+/-1.17%(最佳单次运行:96.20%;宏 F1:94.45%),平均增益 +3.09 个百分点。学生使用的参数比教师使用的 22M 参数少 5.0 倍,同时保留了 98.3% 的准确率。消融表明,中间特征对齐损失会降低准确性,从而使简单的 logits 级 KD 成为最强的配置。公平的从头开始的比较显示,这种收益是特定于起步低于老师的学生的。我们报告每类指标、混淆矩阵、引导置信区间和 FLOP/延迟测量,并讨论包括单一数据集范围和简化的非官方 SSM 实现在内的限制。