论文
针对世界模型来破坏机器人学习管道
Targeting World Models to Compromise Robot Learning Pipelines
摘要
最近,世界模型作为用于生成机器人训练数据或模拟现实世界环境的更有效的数据工具,其受欢迎程度和功能都在快速增长,许多工作建议将其集成到机器人学习管道中。虽然非常实用,但在这项工作中,我们证明世界模型在机器人学习供应链中引入了一个独特的隐秘且有效的数据中毒入口点,尽管使用看似安全的 真值 训练数据进行了训练,但可能会导致部署不安全或受到其他损害的机器人策略。与直接将危险轨迹植入到出售或上传的数据集中的传统数据中毒技术相比,我们新颖的攻击方法将恶意提示或妥协的转换动态注入到明显安全的远程操作数据集中,这些数据只有在通过世界模型作为输入后才会被激活。这可能会导致生成危险的合成机器人训练轨迹,从而导致不安全或受损的机器人策略。我们展示了针对最先进的动作条件和文本条件世界模型的攻击的有效性,展示了下游 DRL 策略的完整端到端后门以及 VLA 设置的概念验证。总的来说,这些发现需要研究更安全的世界模型,并重新评估它们在机器人学习供应链中的地位。