论文
通过数据中毒进行隐秘世界模型操纵
Stealthy World Model Manipulation via Data Poisoning
摘要
基于模型的学习代理使用学习的世界模型来预测未来状态、计划行动并适应新环境。然而,根据收集的经验更新世界模型的过程会产生训练时的攻击面:敌方中毒的 微调 轨迹可以操纵学习到的动态,从而破坏下游规划。在本文中,我们提出了 SWAAP,这是第一个用于学习世界模型的两阶段数据中毒框架。在第一阶段,SWAAP 使用由过渡梯度定理实现的一阶双层优化,识别出有害的目标世界模型,该模型会在规划下引发低回报行为,同时保持接近干净的动态。在第二阶段,SWAAP 通过隐形约束梯度匹配来实现这一目标,仅修改 微调 转换目标的有限部分,以便诱导训练梯度将受害者模型引向对抗目标,而预测误差正则器则鼓励中毒目标保持接近世界模型的自然逼近误差。为了评估攻击的隐蔽性,我们评估了中毒管道三个阶段的防御和可检测性:预训练 中毒转换检测、微调 期间的稳健训练以及对生成的世界模型的测试时监控。在不同的连续控制任务中,SWAAP 会导致性能大幅下降,同时使中毒转换保持接近干净数据并逃避评估的非自适应残差/CUSUM/TRIM 式防御。这些结果揭示了世界模型适应管道中的实际漏洞,并强调需要保护世界 模型训练 数据和学习动态的稳健方法。