论文

解锁视觉语言模型中的 UML 类图理解

Unlocking UML Class Diagram Understanding in Vision Language Models

模型评测基准与评测资源

摘要

尽管视觉语言模型 (VLM) 在各种用例中都取得了巨大进步,但与照片相比,它们在回答有关图表的问题方面仍然落后。尽管在条形图、折线图和其他类似图表领域已经取得了进展,但涉及其他类型图表(例如图表)的研究仍然很少。在计算机科学领域。我们的工作为基于 UML 类图的视觉问答提供了基准,既具有挑战性又易于管理。我们进一步构建了一个包含 16,000 个图像-问题-答案三元组的大规模训练数据集,并表明基于 LoRA 的微调可以轻松胜过 Qwen 3.5 27B,Qwen 3.5 27B 是最近在许多其他基准测试中表现良好的 VLM。