论文

为理解软件架构图而对 VLM 进行基准测试和评估

Benchmarking and Evaluating VLMs for Software Architecture Diagram Understanding

模型评测基准与评测资源

摘要

软件架构图是重要的设计工件,用于在整个软件开发生命周期中传达系统结构、行为和数据组织。尽管 大语言模型 的最新进展极大地推进了以代码为中心的软件工程任务,例如代码生成、测试和维护,但现代视觉语言模型 (VLM) 理解软件架构图的能力仍未得到充分探索。为了解决这一差距,我们提出了 SADU,这是软件架构图理解的基准,它将架构图上的 VLM 作为结构化软件工程工件而不是通用图像进行评估。 SADU 包含 154 个精心策划的图表,涵盖行为图、结构图和 ER 图,并配有结构化注释和 2,431 个涵盖计数和检索推理的问答任务。我们评估了来自 Gemini、Claude、GPT 和 Qwen 系列的 11 个最先进的 VLM。我们的结果表明,软件架构图理解对于当前模型来说仍然具有挑战性:性能最好的模型gemini-3-flash-preview仅实现了70.18%的准确率,而gpt-4o-mini仅实现了17.77%的准确率。结果进一步揭示了图表推理和视觉关系基础方面的弱点,突出了当前 VLM 与设计阶段软件工程需求之间的差距。 SADU 为未来研究图感知人工智能系统和更可靠的人工智能辅助软件工程工作流程奠定了基础。