谁来分析分析仪?使用宪法 Meta-STPA 自我验证 LLM 危害分析
Who Analyses the Analyser? Self-Validating LLM Hazard Analysis with Constitutional Meta-STPA
摘要
大语言模型 (LLM) 越来越受到信任,可以在系统理论过程分析 (STPA) 等严格流程中起草安全分析工件,例如损失、危险、不安全控制措施 (UCA) 和安全约束。然而,这个快速增长的文献中存在一个盲点:除了进行分析的 LLM 辅助工具之外,每个系统都经过分析,该工具本身就是一个安全相关系统,可以产生幻觉标准,发出无法验证的约束,并且不会留下从提示到工件的审计跟踪。我们认真对待该领域忽略的问题——{谁分析分析器?}并通过在工具本身上启用 STPA 来回答它。我们提出了 \{Constitutional Meta-STPA},这是一种围绕闭环构建的 LLM 辅助 STPA 工具:该工具运行人工智能辅助安全工具类的 {meta-STPA},并从由此产生的损失 $\to$hazard$\to$UCA$\to$constraint 链中{推导}而不是断言其治理宪法,产生 $21$ 工具原则和 $8$ 元安全原则的已发布宪法,每个都绑定到一个代码执行点。我们将测量对象形式化为原则集 $P$ ($|P|{=}29$) 上的构成边际覆盖算子,并使用健全性引理将覆盖范围与模型和扫描仪隔离,并报告了四个发现。 {(i)~自推导:}前沿集合 ({claude-opus-4.8}${+}${claude-sonnet-4}) 从工具自己的设计中恢复 $18/21$ 规范和所有 $8/8$ 治理原则,而较弱的对恢复 $12/21$ 和 $3/8$,因此元层是模型限制的,而不是宪法限制的,并且相同$8/8$ 从第二个独立创作的工具中重新出现。