论文

以不适定任务检验VLM如何使用视觉证据

Ill-Posed by Design: Probing Evidence Use in VLMs

模型评测模型能力评测

摘要

反事实分析常用于研究VLM证据使用,但在多个线索独立支持同一答案的适定任务中,移除某个线索可能不改变预测,限制诊断价值。本文以单目物体绝对尺寸估计作为不适定诊断:单张未经标定的图像不能唯一确定物理尺寸,模型必须依赖类别先验、目标外观、局部上下文、表观图像尺寸和场景几何等不完全线索。Metric VQA包含Objectron的10813个尺寸查询和331个实景卷尺测量场景,通过分解六种视觉与语言证据通道,评测十二个开放权重VLM,参数规模3B—397B。即使最大的Qwen3-VL-235B、Qwen3.5-397B和InternVL3.5-241B,在实景子集上仍落后于纯文本前沿LLM。诊断显示目标身份是最重要线索,目标像素与局部上下文只帮助部分模型;表观尺寸会改变预测,却没有稳定的方向性读出;整体场景几何很少被使用。LoRA微调表明尺寸估计任务可以学习,但模型仍未学会利用场景几何。