论文

AdaGuard:通过推理型LLM裁判增强安全与策略合规

AdaGuard: Enhancing Safety and Policy Compliance with Reasoning-Enabled LLM-As-A-Judge Guardrails

AI 基础设施模型训练模型推理监督微调与指令调优强化学习测试时计算扩展AI安全与内容治理基础设施

摘要

企业生成式人工智能应用程序需要强大的安全机制,能够适应不同的风险状况、不断发展的政策和不同的延迟限制。当前的护栏解决方案往往存在僵化问题,依赖于固定的策略集,并且提供有限的透明度或推理灵活性。我们提出了 Adaguard,这是一个自适应LLM裁判框架,旨在通过动态政策执行和自适应推理预算分配来应对这些挑战。 AdaGuard 使用监督微调 (SFT) 和强化学习 (GRPO) 构建,可在运行时推广到用户定义的安全性和合规性策略,而无需频繁更新模型。我们方法的核心创新是能够动态推断输入策略对的复杂性,从而允许模型在高速黑盒推理和可解释的、支持推理的调节之间切换。这种灵活性使开发人员能够平衡严格的延迟要求和可操作的透明度的需求。这种自适应能力使 AdaGuard 能够与其他护栏和边界模型相媲美,其规模是其大小的几倍,而其自动推理模式则以一小部分延迟恢复了始终在线推理的准确性

AdaGuard:通过推理型LLM裁判增强安全与策略合规:论文原图
图 1:AdaGuard 框架接收用户输入以及策略列表,并为每个策略生成违规或合规性判决。 AdaGuard 支持三种推理模式:(1) \rmodereasoning_off:不对任何策略进行推理,(2) \rmodereasoning_on:对所有策略强制执行推理,以及 (3) \rmodeautoreasoning:以自我预测的难度标签为条件的推理。