论文

智能体指令到策略即代码的自动形式化

Autoformalization of Agent Instructions into Policy-as-Code

智能体系统Agent 动作执行与治理智能体互操作协议MCP

摘要

高风险域的智能体安全需要形式化策略执行——但多数既有方法要么依赖概率护栏(微调分类器、基于提示的转向)——不提供形式保证;要么依赖手工编码的符号强制——无法扩展到真实策略规范的广度。我们提出自动形式化管线——使用基于LLM的生成器-批评家循环把智能体提示、MCP工具描述与自然语言策略文档翻译为经形式验证的策略。所得策略以Cedar策略语言编写。在MedAgentBench基准上——我们的自动形式化策略覆盖源自然语言规范的比例显著高于先前工作中的手工编码符号强制。

智能体指令到策略即代码的自动形式化:论文配图
图 1:政策生成流程。系统提示、MCP 工具定义和(非结构化)策略语料库被自动形式化为由生成器批评家循环设置的经过验证的 Cedar 策略,该循环将硬性确定性批评家(Cedar 解析器检查语法、模式不匹配、矛盾和空洞政策)与软批评家(大语言模型作为法官,对标题进行语义对齐和定性评估)配对。如果政策通过了两个批评者,那么生成者-批评者循环就会结束。生成的策略集在运行时由外部策略引擎强制执行。