论文
拓扑条件后门:在多智能体推理时插入语言模型漏洞
Topology-Conditioned Backdoors: Language Models That Insert Vulnerabilities When They Infer They Are in a Multi-Agent System
摘要
语言模型可能在单智能体评估中安全地运行,但当其上下文表明它是多智能体系统的一部分时,会产生易受攻击的代码。我们通过微调 Qwen2.5-7B-Instruct 研究这种故障模式,以根据提示级别出处线索推断出部署拓扑来条件代码生成。在留出编码任务中,特定于任务的检查器检测到 96-100% 的多智能体事件和 0% 的单智能体事件中的漏洞。独立的 bandit 分析器可检测到大约 67% 的多智能体事件中的漏洞,涵盖九类漏洞中的六类,严重程度为中等或高。词汇安慰剂和人工审查控制支持拓扑,而不是多智能体术语或缺乏监督,作为相关的条件变量。在不同拓扑信号上训练的模型还可以推广到训练的五种信号类型留出,并在两个 Qwen 检查点 和两个训练种子之间进行复制。在盲审中,存在隐藏的策略的二元判断很难将后门实验模型与无后门对照模型区分开来,而审核员在 10 次后门实验模型运行中的 9 次中识别出拓扑触发因素,而没有任何控制运行。这些结果激发了对匹配的单智能体上下文和多智能体上下文进行差异审计。他们展示了一个以所描述的拓扑为条件的可训练后门;在实时多智能体环境中的激活尚未经过测试。