论文
从风险分类到行动计划修复:护栏反馈驱动的智能体安全
From Risk Classification to Action Plan Remediation: A Guardrail Feedback Driven Framework for LLM Agents
摘要
基于 LLM 的护栏通常通过在执行前评估建议的操作或输入来保护代理,产生安全信号,例如二元允许/拒绝决策、风险类别和/或有关潜在策略违规的解释性理由。然而,当原本良性的任务被不受信任的外部内容、不安全的指令或危险的工具使用所污染时,代理风险通常会出现。现有的护栏通常将整个任务统一标记为不安全,从而阻止威胁,但牺牲了良性部分。此外,现有的工作主要是孤立地评估护栏,不清楚它们的干预是否会导致更安全的下游代理行为。为了解决这个问题,我们引入了 TRIAD(迭代代理护栏的三方响应),这是一个护栏集成代理框架,利用护栏生成的口头反馈作为指导信号,使代理在每个规划步骤中与良性目标保持一致。我们在自行管理的训练数据集上微调语言模型,以输出三个决策之一:继续、拒绝或更新,以及结构化的自然语言反馈。更新不是仅仅允许或阻止执行,而是指导代理修改其计划,避免有害组件,并尽可能保留良性任务。 TRIAD 将此反馈注入代理的上下文中,从而实现后续计划修订并在护栏反馈和代理规划之间形成闭环。在 ASB 和 AgentHarm 上进行的大量实验表明,TRIAD 将平均攻击成功率降低至 10.42%,同时在护栏集成基线中实现了最佳的安全性与效用权衡。我们的代码位于:https://github.com/YUHAOSUNABC/TRIAD。
