论文
Lattice:面向会话智能体的生成式护栏
Lattice: Generative Guardrails for Conversational Agents
摘要
会话式AI系统需要护栏来防止有害输出,然而现有方法采用静态规则,无法适应新威胁或新部署环境。我们提出Lattice,一个自构建且持续改进护栏的框架。Lattice分两个阶段运行:构建阶段通过迭代仿真和优化从标注样本生成初始护栏;持续改进阶段通过风险评估、对抗性测试和整合来自主调整已部署的护栏。在ProsocialDialog数据集上评估,Lattice在留出数据上达到91%的F1,比关键词基线高43个百分点,比LlamaGuard高25个百分点,比NeMo高4个百分点。持续改进阶段通过闭环优化在跨领域数据上取得7个百分点的F1提升。我们的框架表明,有效的护栏可以通过迭代优化实现自构建。
