论文

为什么大语言模型在 OCL 生成中失败?图推理视角

Why Do LLMs Fail at OCL Generation? A Graph Reasoning Perspective

模型评测模型行为与机制分析

摘要

大型语言模型 (LLM) 越来越多地用于根据自然语言规范和 UML 类图生成对象约束语言 (OCL) 约束。然而,现有的工作主要集中在提高准确性,对这些模型失败的原因了解有限。目标。本研究调查了 OCL 生成中 LLM 失败的根本原因,将任务构建为 UML 类图上的图形推理问题。方法。我们使用 PathOCL 数据集对六个最先进的大语言模型进行了实证评估。我们分析了 UML 结构属性(例如,导航深度和模型复杂性)、词汇相似性、提示排序策略和图形感知提示对 OCL 正确性的影响。结果。我们发现,随着导航深度和结构复杂性的增加,OCL 生成性能显着下降。词汇相似性的影响有限,而 UML 元素的文本排序会影响性能。基于图形的提示产生了部分改进,但并不能消除结构推理错误。结论。 OCL 的生成主要受到图推理的限制,而不是纯粹的语言因素。这些结果凸显了结构推理是当前大语言模型在模型驱动工程任务中的关键瓶颈。