论文
VLAConf:视觉-语言-动作模型的校准任务成功信心
VLAConf: Calibrated Task-Success Confidence for Vision-Language-Action Models
摘要
视觉-语言-动作 (VLA) 模型的任务成功置信度估计为监控开放世界环境中的操作和支持下游决策提供了关键的任务级信号。现有方法通常根据动作标记概率构建任务成功置信度。然而,这样的概率在流量匹配策略中并不自然可用,限制了它们在主流流量匹配VLA中的适用性。为了解决这个问题,我们提出了 VLAConf,这是一个两阶段表示级置信框架,可在冻结的预训练 VLA 表示上运行。分步条件的硬币翻转网络从成功的演示中学习未校准的逆成功支持分数,而安装在结果标记的成功和失败的轨迹采样上的低容量校准器将聚合分数映射到任务成功概率。 LIBERO 基准测试的实验结果表明,与其他方法相比,VLAConf 改进了在线任务成功置信度估计。我们进一步证明了它在选择性专家协助中的实用性,在这种协助中,信心触发的交接比不干预更能提高任务的成功率。其适用性也在真实的机器人实验中得到评估。要访问源代码和补充视频,请访问 https://sites.google.com/view/vlaconf。