论文
CAPRA:使用多代理 LLM 系统扩展软件架构可交付成果的反馈
CAPRA: Scaling Feedback on Software Architecture Deliverables with a Multi-Agent LLM System
摘要
软件工程教育中的自动化评估在代码评分和论文评分方面取得了显着进步。然而,审查软件架构可交付成果需要分析结构完整性和需求可追溯性,但尚未完全自动化。将 大语言模型 (LLM) 应用于此任务需要强大的架构,以确保技术反馈对学生来说准确可靠。本文介绍了 CAPRA(可配置架构熟练度报告评估),这是一个多代理 LLM 系统,可分析软件架构可交付成果以生成个性化的、符合模板的 LaTeX 反馈。作为核心设计选择,CAPRA 协调多个专业代理,并采用基于 Python 的微服务进行多模式文档提取,利用 PyMuPDF 和支持视觉的 LLM(特别是 gpt-4o)来解析文本和 UML 图。为了确保教育可靠性并减轻幻觉,CAPRA 引入了确定性证据锚定步骤,该步骤使用通过标准化 Levenshtein 距离进行模糊匹配,以及交叉验证、重复数据删除和合并发现的 ConsistencyManager 代理。使用结构化的八标准二元评估分类法评估系统性能,涵盖:(i)提取完整性,(ii)特征验证,(iii)问题证据依据和严重性检测,(iv)建议特异性和可追溯性,以及(v)模板和语气合规性。对 10 份学生报告的初步实证评估表明,CAPRA 在严格的两位评估者聚合规则下满足了 88.8% 的评估标准,与人类评估者实现了适度的评估者间一致性(kappa = 0.582),并在略多于 4 分钟的时间内处理了每份报告。虽然这些结果支持 LLM 支持的架构反馈的可行性,但人类监督对于主观评估维度仍然至关重要。