论文

GUARD:基于扩散的 VLA 的依据对齐不确定性和基于消融的风险检测

GUARD: Grounding Uncertainty and Ablation-Based Risk Detection for Diffusion-Based VLAs

AI 基础设施可观测性

摘要

基于扩散的视觉语言动作(VLA)策略可以产生合理的动作,即使它们的预测缺乏定义任务的视觉和语言证据的基础。我们引入了 GUARD,一种测试时故障检测方法,可以在不修改预训练策略的情况下测量与视觉和语言证据的对齐程度。 GUARD 估计最终视觉语言模型键值 (KV) 缓存中标记索引条目的影响,通过消除显着的 KV 条目构建反事实缓存,并将它们的去噪响应与原始条件进行比较。基于比较,我们推导出 GUARD 诊断流,包括敏感性、注意力熵、模态偏差和依据对齐效率,这些诊断流经过在线校准并由轻量级时间分类器处理。我们在 LIBERO、SimplerEnv、MetaWorld 和 PhysicalAI-AV 上使用 Pi0、SmolVLA 和 Alpamayo-1.5,在五个策略基准设置的任务保留拆分下评估 GUARD。 GUARD 在五个未见任务设置中的四个上实现了最佳 ROC-AUC,并在其余设置中排名第二,将平均未见任务 ROC-AUC 比最强的竞争运行时监视器提高了 5.73 个百分点,同时与最佳已见任务平均值保持在 0.19 个百分点以内。这些结果表明,直接探测行动头对多模式证据的依赖性提供了跨策略、任务、实施例和领域的可转移的失败信号。