论文

PolicyGuard:面向LLM智能体策略遵循的对话锚定子智能体验证器

PolicyGuard: A Dialogue-Grounded Sub-Agent Verifier for Policy Adherence in LLM Agents

智能体系统Agent 动作执行与治理

摘要

LLM智能体经工具调用代表组织处理用户请求——并须遵循系统提示中声明的公司政策。先前工作把这当作安全防护问题——阻止不合规智能体动作的外部检查。我们主张政策遵循是更广的问题:真实工作流跨多轮展开——要求显式用户确认与前置读取——并取决于对话内容而非任何单一参数值。达到该标准需要 (i) 完整对话上下文、(ii) 对政策与当前对话的自我推理——(iii) 引导智能体下一轮的对话专属补救——三个既有防护工作常低估的能力。我们介绍POLICYGUARD——子智能体验证器——共享智能体对对话的视图、在上下文中对政策推理——并为智能体下一轮提供可行动反馈。在τ²-BENCH航空域跨三厂商(GPT-5.4、Claude Sonnet 4.6、Gemini 2.5 Pro)每设定四试验——POLICYGUARD使PASS4提升+12.0/+6.0/+12.0个百分点。逐调用分析显示POLICYGUARD取得更高的政策违例召回——同时拦截频率约为参数级护栏的一半。