论文
BadDreamer:针对自动驾驶视频世界模型的可转移后门攻击
BadDreamer: Transferable Backdoor Attacks against Video World Models for Autonomous Driving
摘要
视频世界模型越来越多地用于自动驾驶中,以预测未来场景的演变,并为下游动作预测提供未来感知的时空表示。在感知到行动的管道中,这些表示可以直接影响自我车辆航路点规划,使学习到的未来动态成为关键的安全敏感组件。尽管做出了承诺,但自动驾驶视频世界模型的训练时安全风险在很大程度上仍未得到探索。我们推出了 BadDreamer,这是一种可转移的时空后门攻击,针对该管道的感知端。与操纵图像标签、提示输出或动作监督的传统后门不同,BadDreamer 毒害了视频世界模型的学习转换动态。它构建了触发擦除序列,其中迎面而来的黄色送货骑手在观察到的上下文帧中可见,但从未来的帧中删除。在对此类序列的一小部分执行 微调 后,受损的世界模型学习了隐藏的条件关联:当物理触发器出现时,它会产生幻觉,其中骑手消失,道路显得清晰。我们进一步表明,这种损坏的未来感知表示可以转移到下游动作模块,而无需直接修改自我轨迹标签,从而引发不安全的非规避航路点预测。我们的实验实例化了对代表性开源感知到行动管道的攻击,揭示了自动驾驶视频世界模型中的代表性安全风险,并强调了超越清洁生成质量的后门感知验证的需要。