论文
AutoSpec:通过归纳逻辑编程实现 LLM 代理的安全规则演进
AutoSpec: Safety Rule Evolution for LLM Agents via Inductive Logic Programming
摘要
大语言模型 (LLM) 代理通过将语言模型与外部工具和环境集成,日益自动化复杂的任务。然而,它们的自主性带来了重大的安全风险:代理可能会执行破坏性命令、泄露敏感数据或违反域限制。现有的安全方法面临着一个根本性的权衡:手工制定的规则是可解释的,但很脆弱,过于保守的规则会阻碍安全操作(高误报),而宽松的规则会错过不安全行为(高误报)。神经分类器缺乏安全关键部署所需的可解释性。我们提出了 AutoSpec,这是一个框架,可以通过归纳逻辑编程 (ILP) 指导的反例引导归纳合成 (CEGIS),从用户安全/不安全注释自动演化部署的专家设计的安全规则。从专家规则和带注释的跟踪流开始,AutoSpec 迭代评估规则,挖掘误报和误报反例,使用 ILP 来了解哪些谓词区分它们,生成候选规则编辑,并验证候选规则以选择最佳修订。关键的见解是,ILP 有效地识别经常出现在误报中但很少出现在误报中的谓词(反之亦然),从而极大地修剪了规则编辑的指数搜索空间。这一直持续到收敛,产生平衡精度和召回率的可解释规则。我们在跨越代码执行和具体代理域的 291 个执行跟踪上评估 AutoSpec。 AutoSpec 将两个域的规则 F1 提高到 0.98 和 0.93,在保持高召回率的同时实现高达 94% 的误报减少,并在 4-5 次迭代内收敛。 ILP 引导方法的 F1 比启发式 CEGIS 高出 4.8 倍。学习到的规则是人类可读的、可审计的,并且可以推广到未见过的场景。