论文
POLAR:以工具操作可逆性进行风险预剪枝
POLAR: Ontology-Guided Risk Prevention for Tool-Calling LLM Agents
摘要
LLM 工具使用智能体在动态环境中运行,其中许多操作都会带来操作风险。然而,大多数安全机制仅在错误出现后才做出反应。现有的先发制人方法要么是基于思想链审议的微调或智能体,要么将自然语言护栏编译到运行时检查中,但它们这样做并没有公开结构性的、可审计的结论。我们提出了 POLAR,一个用于调用智能体的小型工具的护栏框架,它通过结构化的两层本体来评估可逆性。 POLAR 通过推导候选逆序列为每个动作分配分级可逆性分数;未达到阈值的调用在执行前会被修剪。在 $τ^2$ 平台上对 6 个智能体模型进行评估后,POLAR 将 6 个智能体中的 4 个模型的平均任务奖励提高了 0.11 到 0.18 个点,但 18 个模型域单元中只有 8 个得到了整体改进;散户和走强的智能体经常会出现倒退。 POLAR 提供可审计的结构检查并描述其任务效用权衡。奖励并不是预防伤害的直接措施。
