论文
Granite.Trust策略工具:面向生成式AI应用的可共享、可执行策略
Granite.Trust Policy Tools: Shareable, Actionable Policies for Generative AI Applications
摘要
对于生成式AI的安全策略,一刀切并不适用。每个组织和使用场景都需要根据应用情境、监管环境、组织价值观和用户画像来缓解不同的风险。然而,现有的策略规范方法是为传统访问控制设计的,无法捕捉GenAI应用的细微之处:基于内容的约束的执行。我们提出两项贡献来弥补这一差距:(1)Actionable Policy(可执行策略)模式(schema),一种基于YAML的格式,用于规定模型响应可以和不可以包含什么。该模式支持基于例外的策略治理,通过提出例外来追踪策略违规;(2)一个合成数据生成管线,为模型对齐和测试生成与策略一致的训练数据,以及一组帮助定义该模式并执行策略的工具。这些共同使组织能够一次性指定策略,并在GenAI应用全生命周期中执行:从模型对齐到运行时监控。Actionable Policy模式、示例策略和工具已开源:https://github.com/ibm-granite/granite.trust.policy-tools。我们欢迎新想法、贡献和反馈。
