论文

Tri-Info:通过信息论对 VLA 模型进行可推广、可解释的故障预测

Tri-Info: Generalizable, Interpretable Failure Prediction for VLA Models via Information Theory

模型评测评测方法与指标

摘要

视觉-语言-动作 (VLA) 模型越来越多地部署在不同的任务中,但它们仍然是黑匣子,其物理交互可能会造成不可逆转的损害,因此可推广和可解释的故障检测至关重要。我们观察到,成功和失败的部署都带有系统不同的信息论特征。在此基础上,我们将 VLA 控制形式化为闭环信息管道,并导出三重信息理论 (Tri-Info) 信号,该信号捕获动作是否保持多样化、时间一致以及与状态转换的耦合。在六个 VLA 模型和三个基准环境中,Tri-Info 匹配了领域内最强的基线。此外,Tri-Info 可以跨架构、环境和模拟与现实之间的差距进行传输,无需使用标记数据进行重新训练,在现实任务中达到 70% 的准确率。这使得 Tri-Info 成为一种简单而强大的方法,不仅可以通过强大的跨域泛化来检测故障,而且还可以提供对底层故障模式的可解释的诊断。