论文
CAKE:大语言模型的云架构知识评测
CAKE: Cloud Architecture Knowledge Evaluation of Large Language Models
摘要
在当今的软件架构中,大语言模型 (LLM) 充当软件架构的副驾驶。然而,目前还没有基准来评估大语言模型对云原生软件架构的实际理解。因此,我们提出了一个名为 CAKE 的基准,它由 188 个经过专家验证的问题组成,涵盖 Bloom 修订后的分类法的四个认知级别——回忆、分析、设计和实施——以及五个云原生主题。对四个 LLM 系列的 22 个模型配置(0.5B--70B 参数)进行评估,对多项选择题 (MCQ) 使用三轮多数投票,对自由回答 (FR) 使用 LLM 法官评分。根据这一评估,确定了四项值得注意的发现。首先,MCQ 准确率稳定在 3B 参数以上,最佳模型达到 99.2%。其次,自由反应分数在所有认知水平上都稳定增长。第三,这两种格式捕获了不同方面的知识,因为 MCQ 准确率接近上限,而自由回答则继续区分模型。最后,推理增强(+think)提高了自由回答的质量,而工具增强(+tool)则降低了小模型的性能。这些结果表明,评估格式从根本上决定了我们如何衡量 LLM 中的架构知识。