论文

(如何)大语言模型 理解高级消息序列图吗?

(How) Do Large Language Models Understand High-Level Message Sequence Charts?

模型评测模型能力评测

摘要

大语言模型被用于软件开发全生命周期,但其处理是否符合相关制品的语义仍不清楚,架构设计规范尤其缺乏研究。论文考察高层消息序列图(HMSC),这是一类具备严格形式语义的可视化模型,也用于构建 UML 序列图。研究用129项任务测试 Gemini-3、GPT-5.4 与 Qwen-3.6,内容从事件及顺序等基本语义构件,到保持语义的抽象与组合,以及计算执行轨迹集合和迹等价的标号迁移系统。结果显示整体准确率约52%,不同概念差异很大:基本 MSC 概念约88%,抽象与组合约36%,执行轨迹与标号迁移系统约42%。三个模型都难理解共区域(co-region)和显式因果依赖,在保持语义的变换中从未采用这两种概念。