论文

量化AI在复杂社会技术系统中采用带来的系统级危害

Quantifying System-Level Harms from AI Adoption in Complex Sociotechnical Systems

模型评测评测方法与指标

摘要

人工智能(AI)正日益融入复杂的社会技术系统,包括关键国家基础设施(CNI),其中危害产生于技术、人和组织要素之间的相互作用。然而,当前的AI评估仍然是模型中心的,对观察到的行为如何转化为系统级风险几乎没有洞见。我们提出一个框架,将结构化危害分析、组件级测试和概率系统建模联系起来,以弥合这一差距。通过提供从模型行为到系统级结果的可追溯路径,该框架使从业者能够回答AI失败的“那又怎样?”,量化其系统性影响,并迈向基于证据的前瞻性AI治理。作为一个示例性案例,我们将该框架应用于英国的实时全额结算(RTGS)系统,使用系统理论过程分析(STPA)推导AI驱动的损失场景,并考察对基于LLM的交易进行对抗性操纵这一损失场景。组件级实验表明,简单的对抗性输入在AI建议被遵循时引起可测量的行为变化。在本文用于金融传染模型的组件到系统映射下,这些变化会改变系统韧性,增加银行倒闭数量并降低冲击导致级联中断的阈值,尤其在AI被广泛或垄断性采用的情况下。

量化AI在复杂社会技术系统中采用带来的系统级危害:论文配图
图1:本工作开发的框架,探索如何利用新旧工具评估在复杂社会技术系统中采用新技术的风险。该框架是模块化的,因而可以按比例应用:实践者可根据其发现、能力与风险容忍度,在A、B或C任一阶段结束均可。对于因不可行而无须进一步技术调查的致害路径,或因缓解措施本就易于实施(如员工培训)的路径,在A阶段结束可能是合适的。若评估认为某组件的行为不构成担忧,或将其投影到统计模型中不可行,则对特定危害的评估可在B阶段结束。