论文

从治理规范到可执行控制:面向智能体AI运行时护栏的分层转化方法

From Governance Norms to Enforceable Controls: A Layered Translation Method for Runtime Guardrails in Agentic AI

智能体系统Agent 动作执行与治理Agent Harness

摘要

智能体AI系统会进行规划、使用工具、维护状态,并产生具有外部影响的多步轨迹。这些特性造成了一个与单轮生成式AI有实质差异的治理问题:重要风险在执行期间出现,而不仅在模型开发或部署时出现。因此,ISO/IEC 42001、ISO/IEC 23894、ISO/IEC 42005、ISO/IEC 5338、ISO/IEC 38507以及NIST AI风险管理框架等治理标准与智能体AI高度相关,但它们本身并不能直接产出可实施的运行时护栏。本文提出一种分层转化方法,将源自标准的治理目标与四个控制层连接起来:治理目标、设计时约束、运行时中介与保证反馈。该方法区分了治理目标、技术控制、运行时护栏和保证证据;引入了用于层次分配的控制元组与运行时可执行性评分准则;并通过一个采购智能体案例研究展示了该方法。其核心主张是审慎的:标准应指导控制在架构、运行时策略、人工升级和审计之间的布局,而运行时护栏仅保留给那些可观察、确定且时间上足够敏感、足以证明执行时干预正当性的控制。