论文

GitHub Actions 工作流程的合规性如何?基于检查表的 LLM 辅助审计研究

How Compliant Are GitHub Actions Workflows? A Checklist-Based Study with LLM-Assisted Auditing

摘要

GitHub Actions (GHA) CI 工作流程是关键的基础设施,但当前的工具仅提供语法或启发式检查,并且不强制执行已记录的安全性、可维护性或性能最佳实践。因此,在现实世界的管道中,诸如特权过高、秘密管理薄弱和丢失故障通知等问题仍然未被检测到。本文提出了一种新颖的、以文档为基础的 GHA 合规性检查表,其中包含涵盖四个工作流程部分和八个主题的 30 条标准,并评估了 大语言模型 (LLM) 以实现可扩展的合规性审计。在使用四个开放权重 LLM 的 95 个真实 Java 工作流程(2,850 个评估)中,我们发现只有公平的一致性(Fleiss' kappa = 0.28),在结构推理和安全敏感判断上存在系统性分歧。为了解决这个问题,我们引入了一个多层裁决框架,其中 GPT 5 在有针对性的手动审查之前解决模型冲突,减少了 81% 的验证工作,同时保留了 87% 与专家判断的一致性。从规模上看,它揭示了主要的合规性差距:整体合规性为 28%,权限控制下降至 4%;安全性 (26%) 远远落后于清晰度 (68%)。我们的结果表明,LLM 可以实现可扩展的合规性测量,但无法取代专家,这凸显了混合人类人工智能审计的必要性,并为可防御的 GHA 工作流程审计提供经验基准和指导。