论文

CAGE:工具Agent在类型化返回不确定性下的授权认证

CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents

智能体系统Agent 动作执行与治理

摘要

工具使用LLM代理基于类型工具返回,记录来源和类别字段与数值值的配对。运行时许可门通常授权观察到的返回和行动,但保护决策不受返回与源之间的小错误影响。我们询问候选动作是否在声明的邻域内保持授权:一个可接受的绑定故障加上可测量的数值漂移。我们证明,分别认证类别和数值通道不会组合:单独对每个通道进行扰动,可以将同一个动作变成不安全的。CAGE直接认证这个共同的邻域,精确枚举每个分支并认证每个分支内的连续扰动。在合成、政策代码、监管和实际交易设置下,CAGE移除预算内的虚假允许,这些允许准确点对点门禁接受,同时保留有用的决策自主性。当策略可执行时,CAGE-Exact认证策略本身;否则,CAGE-Lip和CAGE-RS认证受显式、测量的保真度假设的学得门禁。

CAGE:工具Agent在类型化返回不确定性下的授权认证:论文配图
图1:工具返回后的授权边界。大语言模型读取已验证记录 z̃=(s,x) 和不可信文本 m,后者可能左右所提议的动作 a;门禁只读取 (z̃,a),在架构上排除文本通道。类型化通道经过验证,其残余的绑定不确定性也得到认证。