论文
CAGE:工具Agent在类型化返回不确定性下的授权认证
CAGE: Certified Authorization under Typed-Return Uncertainty for Tool-Using Agents
摘要
工具使用LLM代理基于类型工具返回,记录来源和类别字段与数值值的配对。运行时许可门通常授权观察到的返回和行动,但保护决策不受返回与源之间的小错误影响。我们询问候选动作是否在声明的邻域内保持授权:一个可接受的绑定故障加上可测量的数值漂移。我们证明,分别认证类别和数值通道不会组合:单独对每个通道进行扰动,可以将同一个动作变成不安全的。CAGE直接认证这个共同的邻域,精确枚举每个分支并认证每个分支内的连续扰动。在合成、政策代码、监管和实际交易设置下,CAGE移除预算内的虚假允许,这些允许准确点对点门禁接受,同时保留有用的决策自主性。当策略可执行时,CAGE-Exact认证策略本身;否则,CAGE-Lip和CAGE-RS认证受显式、测量的保真度假设的学得门禁。
