论文

视觉语言模型对 UML 图解释的先验偏差

Prior Bias in Vision Language Models on UML Diagram Interpretation

模型评测模型能力评测

摘要

视觉语言模型 (VLM) 越来越多地应用于软件工程工件,尤其是其含义取决于视觉符号的 UML 类图。然而,目前还不清楚 VLM 是否真的读取了这些图表,或者而是根据预先训练的先验知识来回答类通常如何关联。我们引入了一个受控的 UML 基准,其中每个符合先验的图都与其先验冲突的对应图配对,(1) 保留相同的类名和布局,而 (2) 仅反转关系箭头。我们评估了来自两个模型系列 InternVL3.5 和 Qwen3 的八个开源 VLM,以及两个闭源前沿模型 GPT-5.4 和 GPT-5.4 Mini。在八个开源模型中,反向箭头平均使关系方向准确度降低了 33.48%,而 GPT-5.4 Mini 保留了 10% 的差距。在更难的三类条件下,开源模型的准确率急剧下降 45.28%,GPT-5.4 系列的平均准确率甚至下降 18.62%。缩放只能提供有限的改进,并且取决于家庭。我们的基准测试提出了基于图表的软件理解中的诊断先验驱动故障。我们的工件可在 https://anonymous.4open.science/r/UMLKnowledgeConflict-8461 上找到。