论文

MED-DSLC:通过域监督和 logits 校准进行多专家域分类

MED-DSLC: Multi-Expert-Domain Classification via Domain Supervision and Logit Calibration

模型优化模型合并

摘要

CLIP 等视觉语言模型 (VLM) 通过将图像特征与共享嵌入空间中的文本提示进行比较来实现零样本分类。此功能的基本属性是 logits 跨任意候选类别的全局可比性。然而,VLM 通常使用 LoRA 等技术来适应细粒度域。虽然这提高了域内准确性,但域外准确性却下降了。这导致了一个高度分散的模型生态系统,拥有数千个专门的模型。多专家领域分类旨在通过合并在专业领域独立训练的 LoRA 来解决这个问题。然而,由于独立训练,各领域专家不再制作全局校准的logits。因此,在评估多个特定于域的类集的联合时,异构 logits 量表会引起跨域干扰,并人为地提高域外类的置信度,从而引发预测错误。在这项工作中,我们将域监督和跨域 logits 误校准确定为可扩展多域零样本识别的关键问题。我们提出 MED-DSLC,结合领域监督训练和领域 logits 缩放,以显式恢复全局 logits 可比性。 MED-DSLC 是一种轻量级的 MED 分类解决方案,事实证明,它可以保留域内歧视,同时以最少的数据减少跨域 logits 干扰。跨不同细粒度基准的大量实验表明,它大大提高了 MED 分类问题规模的平均准确度 (+15\%)、跨域鲁棒性和可扩展性。我们的结果表明,在数据高度不平衡的设置下,恢复输出级校准对于在多域专业化下实现真正的零样本 VLM 至关重要。