论文
AdaDINO:用于高效开放词汇边缘推理的上下文自适应 DINO 蒸馏视觉基础模型
AdaDINO: Context-Adaptive DINO-Distilled Vision Foundation Models for Efficient Open-Vocabulary Edge Inference
摘要
始终在线的上下文 AI 在边缘设备上运行语言一致的视觉基础模型 (VFM),其中设备上模型在严格的延迟和功耗限制下是主要的连续计算成本。由于观察到场景上下文及其相关词汇的低频变化,我们提出了 AdaDINO,这是一种自适应框架,它通过将执行与当前场景和任务相匹配来提高设备上 VFM 推理的效率。我们基于一个已知的现象,即缩小模型大小的准确性下降取决于任务,并将其转化为任务级自适应执行。 AdaDINO 将神经架构搜索 (NAS) 集成到从 DINOv2 中提炼出来的语言对齐的 VFM 主干中,训练单个子网系列,以便在运行时高效执行。云上的多模态 大语言模型 (LLM) 以低频调用,从场景上下文中细化候选类集,同时学习选择器激活预计保留目标准确率的最低成本子网。在主干和语义管道保持固定的情况下,仅学习选择就可以在同等分割精度下比最佳固定子网减少 37\%$ 的平均计算量。在零样本分类和开放词汇分割方面,AdaDINO 建立了强大的准确率-效率前沿,在 IN1K 上的 acc@1 中将经过评估的同等大小的模型提高了 7.9\%$,在 ADE20K 上提高了 5.2\%$ mIoU,并在相似的准确度下将平均 FLOP 降低了高达 74.9\%$。