论文

当工具输出变成命令:在工具增强LLM智能体中分离动作诱导与运行时授权

When Tool Outputs Become Commands: Separating Action Induction from Runtime Authorization in Tool-Augmented LLM Agents

智能体系统Agent 动作执行与治理Agent Harness

摘要

工具增强的LLM智能体必须依赖不可信的运行时观测(Observations)来完成开放式任务;然而,当工具输出不再仅仅提供数据,而是开始指定具体动作时,它们实际上变成了能够驱动超出用户意图的现实副作用的“命令”。我们认为,这一风险源于将动作诱导与执行授权混为一谈。为处理这一区分,我们提出SARA,它将动作诱导与执行授权视为不同的运行时角色,并将动作来源与执行权限分离。在观测侧,一个上下文隔离的Action Probe暴露动作诱导语义,并跨步骤持续记录动作来源以作为审查信号;在执行侧,实际工具调用仅依据用户目标和来自已授权成功执行的经审计证据进行授权,同时满足目标、执行链和参数级支持。为在多步执行中保持这种分离,SARA采用No-History-Promotion,防止历史复现将动作来源“洗白”为执行权限。在AgentDojo和AgentDyn上,SARA在四个主要评估设置中将攻击成功率(ASR)限制在不超过0.63%,同时保持有竞争力的任务效用,并在其他Agent骨干上持续降低ASR。

当工具输出变成命令:在工具增强LLM智能体中分离动作诱导与运行时授权:论文配图
图1:SARA 的运行时授权框架。用户请求确立授权根 KK;观测侧动作探针(Observation-side Action Probe)识别诱发动作的语义,并持续维护动作来源 FtF_{t},后者触发持续审查但不授予执行权限;经授权且成功的工具执行累积经审计的执行证据 HtH_{t}。在真实的工具执行边界,SARA 联合使用 KK、FtF_{t} 和 HtH_{t} 来授权候选调用的目标、执行链和参数。