论文

POLAR:以工具操作可逆性进行风险预剪枝

POLAR: Ontology-Guided Risk Prevention for Tool-Calling LLM Agents

智能体系统Agent 动作执行与治理

摘要

LLM 工具使用智能体在动态环境中运行,其中许多操作都会带来操作风险。然而,大多数安全机制仅在错误出现后才做出反应。现有的先发制人方法要么是基于思想链审议的微调或智能体,要么将自然语言护栏编译到运行时检查中,但它们这样做并没有公开结构性的、可审计的结论。我们提出了 POLAR,一个用于调用智能体的小型工具的护栏框架,它通过结构化的两层本体来评估可逆性。 POLAR 通过推导候选逆序列为每个动作分配分级可逆性分数;未达到阈值的调用在执行前会被修剪。在 $τ^2$ 平台上对 6 个智能体模型进行评估后,POLAR 将 6 个智能体中的 4 个模型的平均任务奖励提高了 0.11 到 0.18 个点,但 18 个模型域单元中只有 8 个得到了整体改进;散户和走强的智能体经常会出现倒退。 POLAR 提供可审计的结构检查并描述其任务效用权衡。奖励并不是预防伤害的直接措施。

POLAR:以工具操作可逆性进行风险预剪枝:论文原图
图 2:POLAR 框架的结构概述。在评估的包装器中,根据可用的当前状态投影检查候选工具序列;不会模拟完整的后操作状态,并且在决策时不会调用显示为模块化组件的分类器和意图解析器。