论文

TRAPSBench:视觉语言模型进行编码但无法表达认知约束

TRAPSBench: Vision-Language Models Encode but Fail to Express Epistemic Restraint

模型评测模型行为与机制分析

摘要

当视觉证据被遮挡或混乱时,模型应该放弃。在本文中,我们证明视觉语言模型(VLM)可以在内部区分何时需要弃权,但无论如何都无法表达它。我们引入了 TRAPSBench,这是一个由 1,404 个匹配的物理对组成的程序生成的视频基准,其中单个目标更改使得结果无法从视觉证据中确定。此外,我们引入了惩罚认知校准分数(PECS),这是一种新的稳健指标,要求模型在结果可知时正确回答,在结果不可知时弃权。在跨越 5 个家庭的 16 个 VLM 中,自发约束很差:最佳 PECS 为 0.292。瓶颈是表达,而不是感知:线性探针跨物理域以高达 0.91 AUROC 的隐藏状态解码可回答性;控制单层虚空方向会导致或抑制弃权。我们的结果在三个开放重量家族(Qwen、Gemma、LLaVA)中得到重复。视觉上的失败比文本上的不确定性更为明显:模型检测到文本不可能性的可能性比缺失视觉证据的容易程度高出 4 倍。缩小这种代表性产出差距可能需要产出阶段的干预。