比较 大语言模型 的 Scrum 认证类型问题:准确性、稳定性和错误模式
Comparing Large Language Models on Scrum Certification-Style Questions: Accuracy, Stability, and Error Patterns
摘要
大语言模型 (LLM) 越来越多地用于考试和认证式问答任务,可以系统地评估他们检索、解释和应用特定领域知识的能力。在软件工程中,当问题依赖于严格遵守规范定义、角色、工件和规则时,此类设置尤其相关。本文评估了三个当代 LLM、\textit{GPT-5 mini}、\textit{Gemini 3 Flash} 和 \textit{DeepSeek Chat 3.2} 在回答符合 Professional Scrum Master I (PSM I) 评估格式的 993 个 Scrum 认证式问题时的表现。我们在三种提示策略(\textit{zero-shot}、\textit{chain-of-thought} 和 \textit{source-grounded})下评估模型,并通过重复执行来评估模型内的稳定性。我们还分析了 Scrum 主题和问题格式的性能,并辅以对错误答案中重复出现的错误模式的定性分析。结果显示模型之间存在明显差异,Gemini 3 Flash 的准确率最高,其次是 GPT-5 mini 和 DeepSeek Chat 3.2,而在所有条件下模型内变异性仍然较低。从问题格式来看,模型在单选题上达到了最高的准确率,而多选题和对错题则更容易出错。按主题来看,在规范明确的领域(例如工件、经验主义和产品价值)表现更加一致,但在 Scrum 价值观、自我管理团队和利益相关者\& 客户方面则更加脆弱。定性分析表明,错误是系统性的而不是随机的,涉及过度概括、限制性措辞、复合干扰因素以及常见市场解释和严格的 Scrum 定义之间的冲突。