论文
LiSA:通过保守政策归纳实现终身安全适应
LiSA: Lifelong Safety Adaptation via Conservative Policy Induction
摘要
随着人工智能代理从聊天界面转向读取私有数据、调用工具和执行多步骤工作流程的系统,护栏成为抵御具体部署危害的最后一道防线。在这些设置中,护栏故障不再仅仅是答案质量错误:它们可能会泄露秘密、授权不安全的操作或阻止合法的工作。最严重的失败通常是与上下文相关的:某个操作是否可接受取决于本地隐私规范、组织策略以及违反预部署规范的用户期望。这造成了一个实际差距:护栏必须适应自己的操作环境,但部署反馈通常仅限于稀疏、嘈杂的用户报告的故障,并且重复的 微调 通常是不切实际的。为了解决这一差距,我们提出了 LiSA(终身安全适应),这是一种保守的策略归纳框架,通过结构化内存改进固定基础护栏。 LiSA 将偶尔的失败转换为可重用的策略抽象,以便稀疏报告可以泛化到个体案例之外,添加冲突感知本地规则以防止混合标签上下文中的过度泛化,并通过后验下限应用证据感知置信门控,以便内存重用随着积累的证据而不仅仅是经验准确性而扩展。在 PrivacyLens+、ConFaide+ 和 AgentHarm 中,LiSA 在稀疏反馈下始终优于基于内存的强大基线,即使在 20% 的标签翻转率下,在嘈杂的用户反馈下也能保持稳健,并将延迟性能前沿推向骨干模型扩展之外。最终,LiSA 提供了一条实用的途径来保护人工智能代理免受现实世界边缘风险不可预测的长尾风险的影响。