论文

SAKE:大语言模型 的软件架构知识评估基准

SAKE: Software Architectural Knowledge Evaluation Benchmark for Large Language Models

模型评测基准与评测资源

摘要

大语言模型 (LLM) 越来越多地用作整个软件开发生命周期的助手,但他们推理软件架构的能力在很大程度上仍未得到衡量。架构决策取决于质量属性权衡、设计模式和系统级约束,而这些都不是由针对语法或算法任务的基准测试执行的。我们在 LLM 中引入了 SAKE(软件架构知识评估),这是一种用于评估软件架构知识的标准化且可重复的基准。 SAKE 包含 2154 个专家策划的多项选择题,每个问题都有四个选项,分为八个架构类别和四个上下文长度级别。我们在零次和五次设置下评估了 11 个专有和开放权重模型。总体准确度很高,但不同类别的表现差异显着,揭示了专业实践核心领域的能力差距。 SAKE、其评估脚本和所有结果均作为开源发布,为社区提供跟踪 LLM 中的架构推理的基线。