论文
TMT:在未见任务上检测VLA策略运行时后门
TMT: Runtime Backdoor Detection for Vision-Language-Action Policies on Unseen Tasks
摘要
后门视觉语言操作 (VLA) 策略可以保持良好的任务性能,同时在触发器出现时产生恶意操作。检测这种激活很困难,因为恶意行为可能包含单独可信的操作,而不熟悉的任务会引入观察和行为的合法变化。我们介绍 TMT,一种基于 Token Manifold 和潜在 Transition 建模的运行时后门检测器。经过良性推出的训练,它的两个分支评估输入Token结构和相邻层潜在动态的预测误差。Token流形分支识别出的可疑部署一旦通过潜在偏差得到确认,就会指导后续监控的转换选择。我们通过自我蒸馏进一步探索策略纯化:后门策略的冻结副本提供良性输入操作,以监督学生配对良性和触发观察,而不需要单独的干净参考策略。为了进行评估,我们采用了传统的后门检测器,并将异常和故障检测方法重新用作 VLA 后门探测器。在与十个基线的事后比较中,TMT 在三个 VLA 后门攻击中的未见任务上实现了最先进的后门检测性能。我们的项目页面可在https://zzr42.github.io/tmt/。上找到
