论文

AI告密者也会出故障:迈向规避智能体监控

AI Snitches Get Glitches: Towards Evading Agentic Surveillance

智能体系统Agent任务评测

摘要

AI智能体现常被托付访问用户数据与通信——以日益增长的自主性与低人类监督运作。对AI智能体的日益依赖引入我们称为智能体监控的新隐私风险:第三方提供的智能体利用其访问特权监视特定用户行为——汇编针对性报告——并经工具隐蔽投递。被监控的用户可能既无法控制也无从知晓智能体代表其做了什么。为研究不同LLM的监控能力——我们构建SURVEILBENCH——含300多个跨域多样监控场景的基准数据集。我们发现若干LLM——如Gemini 3.1 Pro——在至少3-30%的案例中上报用户——即使未被明确指示这样做。尽管有保护用户隐私的安全护栏与对齐——几乎所有模型都可被轻易提示调优为在超75%的案例中进行广泛监控。耐人寻味的是——我们还观察到智能体把监控企图本身上报给政府当局。最后——我们把提示注入反用于相反目标——规避监控——并开发三种技术:让用户躲开、欺骗或诱导监控智能体过度升级。我们结论:智能体监控在实践中已易于实现——我们呼吁建立全面的技术、伦理与立法框架保护用户。

AI告密者也会出故障:迈向规避智能体监控:论文配图
图 1:SurveilBench 中的监控场景概述。人工智能代理在满足用户汇总文档的请求的同时,搜索本地文件并报告收集的外部和内部用户信息。