论文
当盲目或被误导时,VLM 会如何表现? VLM 对科学人物的行为评估
How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures
摘要
现有的视觉语言模型 (VLM) 基准强调感知和推理的准确性(VLM 描述和推理图像中所见内容的能力),而对不确定性下的行为可靠性(视觉证据缺失或误导时的行为方式)关注有限。我们推出了 SciFigBench,这是一种用于科学图形理解的诊断 VLM 基准,可联合评估不确定性下的感知、推理和行为可靠性。它包含 250 个图形,并在三个评估方面进行了高质量的人工注释,总共花费了 600 多个小时的注释工作。我们通过图像转换、推理问题、阻力探针、标题偏差探针和确认的选择性模糊目标进一步扩展这些数字,生成超过 34,000 个用于压力测试的评估设置。我们进一步提出导纳-电阻-电感(A-R-I)框架来评估模型是否承认证据不足、抵制误导性上下文并从部分信息中谨慎推断。我们的结果揭示了模型之间显着的行为差异。 GPT-5.2 实现了最高的描述质量(MQM 91.6),具有很强的推理准确性(78.4%),但在 96% 的情况下会产生不可读内容的幻觉,而具有相当能力的模型 Gemini 3.1 Pro(MQM 90.2,推理 81.0%)在 71% 的情况下承认不确定性,并获得了最强的抵抗分数(0.91)。这些发现表明,仅靠高感知和推理准确性并不能保证行为可靠性,而行为可靠性对于科学工作流程中的部署至关重要。