论文
VLM 法官可以排名但不能评分:多模式评估中任务相关的不确定性
VLM Judges Can Rank but Cannot Score: Task-Dependent Uncertainty in Multimodal Evaluation
摘要
视觉语言模型(VLM)越来越多地用作多模态系统的自动判断,但它们的分数没有提供可靠性的迹象。我们通过保形预测来研究这个问题,这是一个无分布的框架,仅使用分数标记对数概率将法官的分数转换为校准的预测区间,无需重新训练。我们首次对 VLM 作为法官的保形预测进行了系统分析,涉及 3 名法官和 14 个视觉任务类别。我们的结果表明,评估不确定性强烈依赖于任务:区间覆盖美学和自然图像分数范围的约 40%,但图表和数学推理的分数范围扩大到约 70%,从而产生多模态评估的定量可靠性图。我们进一步确定了标准评估指标未捕获的失败模式,即排名评分解耦,其中法官在产生广泛的、无信息间隔的同时实现了较高的排名相关性,对响应进行了正确排序,但未能分配可靠的绝对分数。最后,我们表明间隔宽度主要由任务难度和注释质量驱动,即,在干净的多注释器字幕基准上,相同的判断和方法会产生 4.5 倍窄的间隔。代码:https://github.com/divake/VLM-Judge-Uncertainty