论文
PRISM风险信号框架:面向AI行为风险的层级式红线
PRISM Risk Signal Framework: Hierarchy-Based Red Lines for AI Behavioral Risk
摘要
当前的AI安全方法在个案层面划定红线:特定的提示、特定的输出、特定的危害。本文主张红线可以设立得更根本——在支配AI推理的价值观、证据与信息源层级层面。借助PRISM(Profile-based Reasoning Integrity Stack Measurement,基于画像的推理完整性栈测量)框架,我们定义了27个行为风险信号的分类体系,这些信号源于AI系统在价值排序(L4)、证据类型权重(L3)与信息源信任(L2)上的结构性异常。每个信号通过结合绝对排名位置与相对胜率差距的双阈值原则进行评估,产生两级分类(确证风险与观察信号)。与个案式红线相比,基于层级的方法具有三大优势:前瞻而非被动(在危险推理结构产生有害输出之前发现它们)、全面而非枚举(单一价值层级信号可涵盖无穷多的个案违规)、可测量而非主观(建立在经验性强制选择数据之上)。我们利用来自7个AI模型、横跨三个Authority Stack层级的约397,000条强制选择响应,展示了该框架的检测能力,表明该信号分类体系能够有效区分结构极端画像的模型、具有上下文相关风险的模型与层级均衡的模型。