论文

基于层电导的模型特定任务相似度用于视觉语言模型选择

Model Specific Task Similarity for Vision Language Model Selection via Layer Conductance

模型评测评测方法与指标

摘要

尽管开源视觉语言模型(VLM)大量涌现,为特定下游任务选择最优预训练模型仍然具有挑战性。在少样本场景中,由于计算约束和数据限制,穷举式评估往往不可行。现有选择方法未能完全解决这一问题:它们要么依赖数据密集型的代理指标,要么使用对称的文本描述符,忽视了可迁移性固有的方向性和模型特定性质。为解决这一问题,我们提出一个将模型选择建立在视觉编码器内部功能动态之上的框架。我们的方法通过逐层电导(layer-wise conductance)表示每个任务,并通过熵正则化对齐推导出以目标为条件的块重要性分布。在此基础上,我们提出方向性电导散度(Directional Conductance Divergence,DCD),一种非对称度量,量化源任务能在多大程度上有效覆盖目标的显著功能块。这使得可以通过聚合源任务排名来预测目标模型排名,而无需直接推理。在48个VLM、21个数据集上的实验结果表明,我们的方法优于最先进的基线,在NDCG@5上较SWAB取得14.7%的提升。

基于层电导的模型特定任务相似度用于视觉语言模型选择
图2:任务感知中的模型间相关矩阵。架构族内部的高相关性与架构族之间的低相关性表明任务关系具有模型特异性。