论文
AI 代理的运行时合规性验证
Runtime Compliance Verification for AI Agents
摘要
人工智能代理现在通过工具使用、函数调用和多轮对话来处理个人数据,这可能会产生《通用数据保护条例》(GDPR) 下的义务。目前的测试实践主要依靠离线红队或静态提示审查,但它们并不能保证运行时代理行为遵循监管规则。我们提出了 C-Trace(基于合规性跟踪的运行时代理一致性执行),这是一种验证框架:(i) 表达 GDPR 要求的子集,包括同意、目的限制、数据最小化和删除权,作为代理执行跟踪的正式策略谓词; (ii) 使用运行时监视器来拦截每个工具调用和模型输出并拒绝不合规的操作; (iii) 使用攻击对话测试代理,包括 DSPy 生成的提示和来自红队语料库的逐字提示,试图引发违规行为。我们评估了根据 GDPR 重新构建的四个案例研究的框架。在每类别提取器噪声为 10%(包括丢失和过度输入)的情况下,监视器将攻击成功率保持在小于或等于 12%,低于我们比较的基线,误报率小于或等于 16%,并在完美提取下达到 0% ASR。