论文
LLM可以学习和应用多级建模语义吗?第一个实证研究
Can LLMs Learn and Apply Multi-Level Modelling Semantics? A First Empirical Study
摘要
工业5.0强调以人为本的工业系统设计,对建模工具提出了额外的要求。多级建模(MLM)可以直接表示三个或更多抽象级别,但这是以模型正确性所依赖的更复杂的语义约束为代价的。 大语言模型 (LLM) 在模型驱动工程中得到了越来越多的研究,但这一证据完全依赖于两级建模任务,并且它是否可以推广到语义不同的 MLM,仍然未经测试。本文首次对此问题进行了实证研究。我们使用三个商业 LLM(GPT-5.4、Claude Opus 4.6 和 Gemini 3.1 Pro)在六种提示策略下以 SLICER 语言为 MULTI Warehouse Challenge 生成多级模型,与使用 14 个指标的手动验证参考进行比较,生成 90 个生成的模型。句法正确性触手可及,但语义正确性仅部分实现,实例化/专业化正确性范围为 52% 至 79%。模型会重现任务文本中明确陈述的内容,但很少会完整地完成文本暗示的结构和约束而无需说明。提示策略需要权衡精度和完整性,而自检功能主要是作为规则检查器,而不是可靠地改善与参考设计的一致性。在三人LLM中,克劳德展现出最为平衡的轮廓。这些结果阐明了当前 LLM 传销能力的边界,并为工业 5.0 以人为本、人工智能辅助的建模工作流程的设计提供了信息。