论文

TMT:在未见任务上检测VLA策略运行时后门

TMT: Runtime Backdoor Detection for Vision-Language-Action Policies on Unseen Tasks

模型评测模型优化应用与实践蒸馏安全与风险评测机器人

摘要

后门视觉语言操作 (VLA) 策略可以保持良好的任务性能,同时在触发器出现时产生恶意操作。检测这种激活很困难,因为恶意行为可能包含单独可信的操作,而不熟悉的任务会引入观察和行为的合法变化。我们介绍 TMT,一种基于 Token Manifold 和潜在 Transition 建模的运行时后门检测器。经过良性推出的训练,它的两个分支评估输入Token结构和相邻层潜在动态的预测误差。Token流形分支识别出的可疑部署一旦通过潜在偏差得到确认,就会指导后续监控的转换选择。我们通过自我蒸馏进一步探索策略纯化:后门策略的冻结副本提供良性输入操作,以监督学生配对良性和触发观察,而不需要单独的干净参考策略。为了进行评估,我们采用了传统的后门检测器,并将异常和故障检测方法重新用作 VLA 后门探测器。在与十个基线的事后比较中,TMT 在三个 VLA 后门攻击中的未见任务上实现了最先进的后门检测性能。我们的项目页面可在https://zzr42.github.io/tmt/。上找到

TMT:在未见任务上检测VLA策略运行时后门:论文原图
图 1:用于运行时后门检测的 TMT 概述。在冻结的 VLA 主干上,Token流形分支评估以先前查询为条件的输入Token结构,而潜在转换分支对选定的一对相邻层的预测误差进行评分。当任一分支的分数超过其单独校准的阈值时,就会发出警报。