论文

迈向自动化领域建模的标准化评估:一个基准的提出

Towards Standardized Evaluation in Automated Domain Modeling: Introducing a Benchmark

模型评测基准与评测资源

摘要

领域建模在领域驱动设计中扮演重要角色,捕捉特定领域内的核心实体及其关系。尽管自动化领域建模已有进展,但标准化基准的缺失阻碍了对现有方法的比较评估。本文介绍一个旨在填补这一空白的基准。该基准把Zenodo上45条记录的Golden UML Modelset(Verbruggen等,2025,由Calamo、Mecella和Snoeck的Text2UML项目分发)与Chen等人的8条记录参考档案(Chen等,2023a,b)相结合,使自动化领域建模方法能够在不同复杂度和规模层级上得到评估。给定一段自然语言描述,任务是生成对应的领域模型;对每段描述,提供一个参考领域模型作为真值;用一个指标把生成的领域模型与对应真值模型进行比较。为展示该基准的效用,我们评估了多种自动化领域建模方法,包括启发式规则方法和LLM驱动策略。依据FAIR4RS建议(Chue Hong等,2022),该基准作为研究工件提供,以鼓励复用并支持未来自动化领域建模研究。

迈向自动化领域建模的标准化评估:一个基准的提出:论文配图
图1. 基准概览:一个(自然语言文本,参考 PlantUML 类图)配对被输入候选策略,候选策略生成候选 PlantUML 图,再由某项指标将其与参考图进行比较。