论文

一致多图 SysML 的验证数据集与基准

A Validated Dataset and Benchmark for Coherent Multi-Diagram SysML Models

模型评测基准与评测资源

摘要

系统工程师使用多个图表来描述系统的结构和行为。工程师一起创建这些图表,以确保它们使用相同的元素并保持彼此一致。 大语言模型可以生成文本或代码形式的图表,这使得自动创建系统图表成为可能。然而,它们生成连贯图表集的能力还没有被很好地理解,并且现有的数据集和基准不能直接大规模地衡量这种能力。我们引入了 SEMAADB(带有 AI 数据集和基准的系统工程建模助手),这是一个包含 3,000 个工程上下文和 15,000 个图表的数据集。每个上下文包含五个连接的 SysML 视图:需求、块定义、活动、状态机和序列。这里,视图是表示系统的一个方面的图表。我们检查了图表集的一致性和有效渲染。一组 100 个上下文也经过人工验证,形成基准测试集。我们在两项任务上评估三种语言模型。在图修复中,最强模型修复了 64.3% 的语义错误。在跨图更新中,当模型跨相关图应用一项更改时,最佳传播 F1 为 80.7%。结果表明,语法修复已基本解决,但语义修复和跨图一致性对于模型来说仍然是具有挑战性的任务。因此,SEMAADB 提供了大量图表资源和一组用于测量连贯多图 SysML 生成的基准。