论文

GuardianAgent:结合经验证对抗升级的策略条件化、风险自适应匿名化

GuardianAgent: Policy-Conditioned Risk-Adaptive Anonymization with Verified Adversarial Escalation

智能体系统Agent 动作执行与治理

摘要

实时网络流量的隐私保护需要的不仅仅是检测私人跨度。基于代理的隐私保护系统必须确定传出操作是否符合目标站点的隐私策略,然后仅应用由剩余泄露风险证明合理的重写或清理级别。我们提出 GuardianAgent,一个策略条件匿名框架,将结构化风险评估与经过验证的自适应重写结合起来。 GuardianAgent 通过 AMRSF(自适应多因素风险评分公式)计算风险,AMRSF 是一种显式控制器,将违反政策的可能性与数据敏感性、接收者传输、目的合法性、上下文基础和政策透明度相结合,而不是依赖LLM直接分配风险。该风险评分决定允许/转换/拒绝决策和初始匿名化级别。为了提高效率,GuardianAgent 使用证据快速路径来进行低不确定性的策略匹配,并仅针对不确定的情况调用 LLM 慢速路径。对于重写,它应用了由经过验证的对抗性猜测器驱动的五级层次结构:只有在原始文本支持的情况下,猜测才会触发升级,从而防止攻击者的幻觉导致不必要的过度匿名化。涵盖法律文本 (TAB)、Reddit 帖子 (SynthPAI) 和多格式合成 PII 记录 (PII-Masking-300k) 的三个基准的实验表明,GuardianAgent 在已发布的基准中实现了最强的隐私与效用权衡,并且是在所有三个域中达到超过 0.90 隐私的唯一方法,在主干交换机下保持稳健。动作上下文压力测试进一步表明,相同的传出文本在不同的接收者、目的、行动基础和政策透明度条件下会收到不同的决策和匿名化强度。

GuardianAgent:结合经验证对抗升级的策略条件化、风险自适应匿名化:论文配图
图1:监护机构框架。政策对应估计违规可能性LL和AMRSF将其转换成有行动条件的风险分数。分数有两个效果: 它决定了动作决定 yallow, transform, deny} y\in{ texttt{ allow},\ textt{ transform},\ textt{ deny} 。 对于转换的动作, 它的正统变换带位置 zz 选择初始匿名级别 l0 (z)\ell\\\\\\\\}(z) 。当发现泄漏时,等级匿名器就会上升。