论文

审视Auto-DSM:面向基于LLM的DSM生成的黑盒评估框架

Auto-DSM Under the Lens: A Black-Box Evaluation Framework for LLM-Based DSM Generation

模型评测评测方法与指标

摘要

本文提出一个黑盒评估框架:系统评估LLM从结构化技术文档生成设计结构矩阵(DSM)的能力。鉴于当前Auto-DSM管线的闭源性质,框架引入可复现方法学——以人工验证的真值矩阵(GT-DSM)为基准评估生成的DSM(GEN-DSM)。评估整合单次与多次运行视角,组合结构指标(完整性、正确性、耦合密度)、分类指标(选择性准确率、弃权覆盖)与稳定性度量(熵、Fleiss' κ);并提出综合质量分Q加以合成。在两个数据集上做受控实验:虚构抽象系统与真实冰箱分解——覆盖措辞变化、参数—数据集对齐与系统复杂度。结果显示:LLM能产出结构上合理的DSM并在良构输入下取得高可复现性,但对歧义、不一致的依赖定义与提示表述仍敏感。发现凸显幻觉与弃权失败的系统性来源——展示LLM驱动DSM自动化的潜力与当前局限。所提框架为审计Auto-DSM管线提供透明基准,并把LLM分解方法整合进基于模型的系统工程(MBSE)工作流奠定基础。

审视Auto-DSM:面向基于LLM的DSM生成的黑盒评估框架:论文配图
图 6:冰箱系统分解实验装置示意图