论文
智能体指令到策略即代码的自动形式化
Autoformalization of Agent Instructions into Policy-as-Code
摘要
高风险域的智能体安全需要形式化策略执行——但多数既有方法要么依赖概率护栏(微调分类器、基于提示的转向)——不提供形式保证;要么依赖手工编码的符号强制——无法扩展到真实策略规范的广度。我们提出自动形式化管线——使用基于LLM的生成器-批评家循环把智能体提示、MCP工具描述与自然语言策略文档翻译为经形式验证的策略。所得策略以Cedar策略语言编写。在MedAgentBench基准上——我们的自动形式化策略覆盖源自然语言规范的比例显著高于先前工作中的手工编码符号强制。
