论文

Lattice:面向会话智能体的生成式护栏

Lattice: Generative Guardrails for Conversational Agents

模型推理推理验证与自校正

摘要

会话式AI系统需要护栏来防止有害输出,然而现有方法采用静态规则,无法适应新威胁或新部署环境。我们提出Lattice,一个自构建且持续改进护栏的框架。Lattice分两个阶段运行:构建阶段通过迭代仿真和优化从标注样本生成初始护栏;持续改进阶段通过风险评估、对抗性测试和整合来自主调整已部署的护栏。在ProsocialDialog数据集上评估,Lattice在留出数据上达到91%的F1,比关键词基线高43个百分点,比LlamaGuard高25个百分点,比NeMo高4个百分点。持续改进阶段通过闭环优化在跨领域数据上取得7个百分点的F1提升。我们的框架表明,有效的护栏可以通过迭代优化实现自构建。

Lattice:面向会话智能体的生成式护栏
图1:两阶段框架架构。构建阶段(上)从带标注的对话出发,通过三个迭代步骤生成初始护栏:(1) Conversation Simulation 在合成对话上测试当前护栏;(2) Performance Evaluation 计算 precision、recall 和 F1;(3) Guardrail Optimization 基于假阳性与假阴性创建、删除、收紧、放宽或聚类护栏。持续改进阶段(下)通过四个步骤使已部署的护栏适应无标注对话:(1) Risk Assessment 通过双重检查评估识别覆盖缺口;(2) Case Expansion 生成对抗性变体;(3) Guardrail Optimization 更新策略;(4) Performance Evaluation 验证变更,若性能下降则回退。