论文

确定性、可审计的人工智能安全风险评估框架,具有 ATLAS 一致的可执行规则和形式验证

A Deterministic and Auditable AI Security Risk Assessment Framework with ATLAS Aligned Executable Rules and Formal Verification

AI 基础设施AI安全与内容治理基础设施

摘要

人工智能系统越来越多地部署在高影响和安全关键的环境中,但安全评估仍然难以在审计中重现和防御。现有的方法通常依赖于叙述清单或评估者驱动的评分,并且缺乏从可观察的工程制品到稳定的技术水平结果的明确的、机器可评估的映射。我们提出了一个证据驱动的人工智能安全评估框架,将评估作为确定性决策函数进行操作。该框架将异构工件规范化为项目独立的控制 ID 分类法,在有界四级序数尺度上评分,通过显式缓解控制映射从固定的 MITRE ATLAS 快照编译技术级谓词,并输出技术索引的可行性和影响级别,并带有可追溯的链接返回触发证据。我们将所有规范选择打包为版本化评估策略对象,以支持跨快照的可重复重新评估。为了确保语义正确性,我们正式验证了已编译评估器在完整声明的分数域上的有界性、完整性、有序语义一致性和单调性。我们评估了固定到显式存储库快照的五个公共开源人工智能项目的框架,在统一强化干预下量化变更前后,并通过基于分叉的软件物料清单 (SBOM) 生成和持续集成 (CI) 安全扫描门的实现来验证对实际工程变更的响应能力。结果表明,在加强可观察控制的情况下,可行性概况持续向下变化,而当证据范围中不存在技术特定的核心控制时,最坏情况下的剩余可行性仍然存在。