AnchorScore:基于 CLIP 的 MLLM 注释难度诊断
AnchorScore: A CLIP-Based Diagnostic of MLLM Annotation Difficulty
摘要
多模态 大语言模型 (MLLM) 广泛用于自动注释,但它们的每类准确度差异很大(例如,三个教室子数据集的 13 个类的准确度为 12%-98%),并且测量成本昂贵:在 5,416 个验证图像上评估一个 27B MLLM 大约需要 14 小时,而对相同图像的冻结 CLIP 传递大约需要 3 分钟即可完成。根据预期 MLLM 注释难度先验对类别进行排序的低成本信号仍未得到充分探索。基于配套研究中引入的 AnchorProxy 构造(每类零样本 CLIP 精度),本文系统地评估了其全帧公式(此处称为 AnchorScore),作为标记 MLLM 最不可能可靠注释的类的先验诊断。在课堂行为数据(SCB5、13 个班级、6 个 MLLM)上,AnchorScore 与每个班级的 MLLM 准确性相关(Spearman rho = 0.769,p = 0.002,n = 13)。在 n = 13 时,其他难度预测因子(DINOv2、ResNet-50、SigLIP 或 MLLM 自言式不确定性)均未显示出显着的类别级别相关性。跨模型共识控制表明 AnchorScore 主要捕获共享的类别难度因子,而不是 CLIP 特定信号。在Stanford40 Actions 上进行的独立复制产生了几乎相同的效果(rho = 0.817,p < 0.001);该协会在活动识别数据方面最强,在医疗和卫星图像方面减弱。接下来是三个实际应用:可部署的混合 CLIP/MLLM 路由策略(预测类路由:仅在 MLLM 调用减少大约 44% 的情况下,比 CLIP 最多 +23 pp)、对硬类的提示歧义消除(探索性)以及用于人工验证的审查优先级预测。 AnchorScore 无法估计准确的 MLLM 准确度;它提供了一个低成本的排名信号,将昂贵的 MLLM 评估引导至信息最丰富的类别。