论文

通过混合评估对架构生成需求进行基准测试

Benchmarking Requirement-to-Architecture Generation with Hybrid Evaluation

摘要

软件架构充当软件系统的蓝图,捕获影响下游实施和系统质量的高层结构决策。尽管发挥了这一核心作用,但从需求文档生成架构设计仍然没有得到充分探索,用于生成或严格评估的特定于任务的基准有限。为了弥补这一差距,我们引入了 R2ABench,这是需求到架构 (R2A) 推理的基准。 R2ABench 包含 68 个项目,其中包含从教育风格设置和 GitHub 存储库收集的经过人工验证的参考资料。每个项目都打包为一个统一的实例,提供结构化软件需求规范 (SRS)、PlantUML 中的参考架构视图以及相应的源需求工件。为了评估生成的架构视图,我们设计了一个分层混合评估框架,涵盖语法验证、结构图诊断以及语义和基于证据的架构评分。使用这个框架,我们对 R2ABench 上最先进的 LLM 和代理进行了全面的实证研究。我们发现当前的系统通常可以生成语法上有效且可读的架构视图,但仍然难以跨两个子集进行关系级架构建模:组件识别比边缘恢复强得多,而边缘幻觉是主要的结构故障模式。从语义上讲,结构保真度并不能保证需求覆盖范围或可追溯性,而这些是主要的质量差距。相关数据文件可从 https://figshare.com/s/01f0a5fb6243a6a60f23 获取。