论文

开源人工智能风险缓解工具的分类驱动分析

Taxonomy-Driven Analysis of Open-Source AI Risk Mitigation Tools

模型评测评测方法与指标

摘要

大语言模型 (LLM) 在企业环境中的快速采用带来了运营、安全和治理风险。随着生成式人工智能应用从试点转向生产,手动危害识别和缓解变得难以扩展。尽管许多工具支持模型评估、对抗性测试、运行时护栏和可观察性,但工具环境仍然支离破碎。工具通常是为特定的工程任务而设计的,并以与治理框架或风险分类法不相符的技术术语进行描述,因此很难确定哪些工具可以解决哪些风险以及哪里仍然存在关键差距。本文提出了一种结构化协议,通过对开源 LLM 评估和安全工具进行分类驱动的分析来自动化 AI 风险缓解。我们将 21 个著名开源工具的功能映射到扩展的 MIT AI 风险缓解和响应分类法的 32 个子类别。 LLM 辅助检索增强生成管道分析源代码和文档,以提取每个分类类别的功能。三位独立评审员的可靠性评估得出了中等程度的一致性(Fleiss' Kappa = 0.509)。分析揭示了一种高度倾斜的格局,其中工具集中在技术和运营控制周围,而治理、法律和监管以及金融和市场控制在很大程度上仍未得到解决。这激发了分层风险缓解架构,将基于工具的控制与组织和监管流程相结合。经过多数投票后,映射协议的 F1 分数达到了 75.5%。总体而言,该研究提供了企业人工智能风险类别和开源缓解能力之间的实用映射,确定了仍然需要人工监督的地方,并提出了适用于开源和专有解决方案的分类驱动框架。