论文
SAFESHIELD:小语言模型部署的安全决策组织框架
SAFESHIELD: A Decision-Organization Framework for Deployment-Time Safety of Small Language Models
摘要
语言模型的部署时安全通常通过运行时防护来实现,例如输入审核、路由、检索验证和输出过滤。现有的部署框架为这些功能提供了越来越强大的机制,但对于如何明确组织、协调和审核它们产生的安全决策提供了有限的指导。我们将部署时安全性表述为一个决策组织问题,具有两个要素:安全决策的面向责任的分解和它们之间的明确协调。我们在 SAFESHIELD 中实例化了这个公式,SAFESHIELD 是一个用于小语言模型的部署时安全系统,它组织四个重复的决策职责(准入、路由、证据和发布),并在可审计的决策跟踪中记录已提交的决策。我们通过机制级实验、聚合阶段 消融、受控协调 消融 和面向部署的压力套件来评估 SAFESHIELD。机制级结果表明,实例化的防护措施提供了决策过程所需的功能,而随着周围安全组织的移除,总体 消融 显示端到端安全性大幅下降。更重要的是,专门的协调 消融 保留了参与的保护机制,同时有选择地切断它们的依赖性:消除准入门控大大增加了错误发布,并且在发布决策中隐瞒上游证据将发布准确性从 96.0% 降低到 69.5%。这些结果提供了系统级证据,表明部署时的安全性不仅取决于各个护栏的功能,还取决于其决策的组织和协调方式。
