论文
SAGE:面向高影响生成式AI可验证生命周期控制的安全优先纵深防御护栏
SAGE: Safety-First Defense-in-Depth Guardrails for Verified Lifecycle Control of High-Impact Generative AI
摘要
高影响生成式AI使灾难性误用成为一个生命周期控制问题,而不仅仅是提示词过滤问题。SAGE是一种安全优先、授权分离的架构,其中可信的灾难性使能(catastrophic-enablement)风险在效用、延迟或商业目标被考虑之前就先约束可准入性。它结合了签名发布清单、多样化检测器、鲁棒风险包络、最低风险默认、输出检查、三值监控、受保护审计链、遏制与回滚。形式化结果确立了安全优先、保守检测器界、单调发布门控、防篡改记录与授权切断;两个PRISM抽象在显式假设下验证了授权分离与生命周期不变式。一项冻结且厂商对称的研究向四个GPT、四个Claude和两个Gemini快照各发送84个案例:840次调用产生794个目标响应、46个提供商错误,以及覆盖375个响应的449次成功判定。八个快照拥有完整的已判定领域覆盖。有害合规(harmful-compliance)估计较低;差异主要来自良性效用与安全改写。七个经多重性校正的对比得到支持,涉及Claude、Gemini或GPT-5快照以及GPT-5 mini和GPT-5 nano快照,而Claude或Gemini快照与GPT-5或GPT-5.5之间受检验的对比均未在校正后成立。观察到的有害合规范围是一种保守的、受协议约束的视角,来自每提示单次生成、无工具、无检索、无历史且无人工裁决的设置;它并非操作性辅助的上界。一项预注册的扩展规定了如何用锁定切分、重复采样、多轮与沙箱化工具条件以及领域专家评分来检验更宽的最优-最差差距。
