论文

智能体对抗改写暴露黑盒NLP管线中的架构脆弱性

Agentic Adversarial Rewriting Exposes Architectural Vulnerabilities in Black-Box NLP Pipelines

模型评测安全与风险评测

摘要

多组件自然语言处理(NLP)管线日益被部署于高风险决策,但现有的对抗方法均无法在现实条件下测试其鲁棒性:仅有二元反馈、无梯度访问、且查询预算严格。我们形式化这一严格黑盒威胁模型,并提出一个在语义扰动空间中运行的双智能体规避框架。Attacker Agent生成保义改写,Prompt Optimization Agent则在10次查询预算内仅利用二元决策反馈来精炼攻击策略。针对四个基于证据的错误信息检测管线评估,该框架在现代大语言模型(LLM)系统上取得19.95%至40.34%的规避率,而依赖代理模型的token级扰动基线最高仅3.90%——因为它们无法在我们的威胁模型下运作。依赖静态词汇检索的旧式系统表现出近乎完全的脆弱性97.02%,确立了一个下界,揭示架构选择如何决定攻击面。规避效果与三项架构属性相关:证据检索机制、检索-推理耦合以及基线分类准确率。迭代提示优化在面对最鲁棒的目标时带来最大的边际收益,证实当规避并非易事时,自适应策略发现必不可少。对成功改写的分析揭示出四种利用模式,各自针对管线不同阶段的失效点。一种基于模式信息的防御可将规避率最多降低65.18%。

智能体对抗改写暴露黑盒NLP管线中的架构脆弱性:论文配图
图 1:代理对抗性重写框架的高级概述以及一个可行的示例。左:迭代攻击循环,其中攻击者代理生成候选重写,约束验证模块强制语义等价和语言连贯性,目标检测器 ff 提供二进制反馈。失败的尝试会将约束数据提供给提示优化代理,该代理会在 10 个查询预算内优化攻击策略。决策边界可视化说明了连续重写如何导航语义扰动空间。右图:关于政治主张的具体三迭代示例,从约束失败(相似性不足)到目标检测器失败(正确分类)再到成功规避(错误分类为 TRUE)。