论文
FabriMAE:我信任自己吗?基于马尔可夫注意力熵的VLA动作生成自评估
FabriMAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy
摘要
视觉-语言-动作模型(VLA)将视觉感知、语言指令和动作生成整合为跨异构架构的端到端策略。然而,让VLA在无外部监督的情况下自评估其动作生成可靠性仍是一个重大挑战。现有方法要么依赖专家标注,要么仅从输出统计中估计不确定性,很大程度上忽略了内部信号。在这项工作中,我们观察到内部视觉模态熵在异构VLA上于成功任务与失败任务之间表现出一致的区别。尽管VLA在动作生成上的架构各不相同,我们证明它们共享一个在视觉感知、语言指令和状态输入下演化的共同潜在动作生成抽象,我们将其形式化为条件生成马尔可夫链。基于这一形式化,我们提出MAE(Markov Attention Entropy,马尔可夫注意力熵),一个将内部注意力信号直接转换为架构感知可靠性评分的自评估框架,并引入LIBERO-Reflect,一个包含4,000条回合的基准,由2,000条标准回合和2,000条跨四个子集的挑战性回合组成。在异构VLA架构和多样场景下的大量实验表明,MAE在AUPR、AUROC和FPR@95上持续优于最先进的基线。我们进一步实例化FabriMAE用于无验证器的测试时动作选择,结果表明MAE引导的多次采样以较小的观测运行时开销提升了PI系列模型在LIBERO-Plus上的鲁棒性。