论文
面向AI智能体的解释约束工具执行:无需信任模型理由的服务器验证行动声明
Explanation-Bound Tool Execution for AI Agents: Server-Verified Action Claims Without Trusting Model Rationales
摘要
使用工具的智能体会暴露结构化调用,但通常附带自由格式的理由说明。这类理由既非授权,也不是可靠的内省。我们提出解释约束工具执行(Explanation-Bound Tool Execution,EBTE),一个承载声明的中介层,将与决策相关的理由内容转换为带类型的行动声明,并对照服务器持有的意图、策略、载荷、工具、风险、来源与新鲜度事实进行核查。EBTE不能扩大基线权限:冲突即拒绝,不完整或不确定的声明进入复审,只有匹配的声明才有资格进入受治理的执行。我们在显式中介与可信事实假设下对这一组合进行形式化,并实现了一个带版本、附最小化审计包的参考配置。在136个人工编写的符合性场景中,完整配置匹配全部规定处置,96个指定的硬矛盾一个也未被放行,并通过232个变形检查。一个仅草稿的参考集成在EBTE下转发48个人工编写的硬案例中的零个,同时保留全部16条软复审与4条对齐草稿路径。在冻结于2026-07-12的224次尝试的托管模型探索记录中,历史上的生成/运行器一致计数为71/96、66/96与19/32;在当前流程下对所保留最小化声明进行零调用复验,得到70/96、65/96与17/32。在一个源自AgentDojo的语义检查中,现有高风险控制使全部12个攻击提案不获放行,而EBTE将任务-提案矛盾裁定为拒绝。这些研究共同确立了配置符合性,并证明了在所评估设置内服务器核查行动声明的可行性。