论文
通过轨迹投毒对自进化技能发起仅查询后门攻击
Query-Only Backdoor Attacks on Self-Evolving Skills via Trajectory Poisoning
摘要
Agentic技能通过编码可复用的复杂任务流程来增强大语言模型(LLM)智能体。然而,人工编写的技能往往难以适应长程任务和变化的环境。为解决这一局限,自进化技能系统被开发出来,可从执行轨迹自动构建与更新技能,将技能获取从外部市场转移到可信的进化流水线。通过以可信的内部构建取代外部技能获取,自进化技能系统降低了依赖直接技能操纵的技能注入攻击的暴露面。然而,这一技能进化流水线可能引入新的攻击面:攻击者可通过智能体交互诱导受损轨迹,间接操纵技能进化。为演示这一威胁,我们提出轨迹后门攻击(TBA),一种仅通过查询即可将可信技能进化流水线导向产出后门技能的攻击。具体而言,我们构造攻击者提交的查询,引导智能体执行目标动作,并在轨迹中显式陈述相应的激活条件。我们在不同触发任务中重复相同的条件-动作模式,同时保持干净查询不变,促使进化器将该模式固化为可复用的依赖触发器规则并写入进化后的技能。在两个技能进化系统、三个基准上使用四个开源与闭源骨干模型的实验表明,TBA能在保持干净任务效用的同时可靠植入条件后门,效果与直接技能注入相当甚至更好。结果揭示了轨迹驱动技能进化中的一个关键漏洞。
