论文
序列任务中的时间差异校准:在视觉-语言-动作模型中的应用
Temporal Difference Calibration in Sequential Tasks: Application to Vision-Language-Action Models
摘要
机器人视觉-语言-动作(VLA)模型的最新进展凸显了连续任务中可靠的不确定性量化的重要性。然而,在这种情况下评估和改进校准仍然大部分尚未探索,特别是当仅观察到部分轨迹时。在这项工作中,我们为情景任务制定了顺序校准,其中任务成功信心是在一个情景中产生的,而成功是在情景结束时确定的。我们引入了 Brier 分数的顺序扩展,并表明,对于二元结果,其风险最小化与 VLA 策略的价值函数一致。这种连接将不确定性校准和强化学习联系起来,从而能够使用时间差 (TD) 值估计作为随时间变化的原则性校准机制。我们凭经验表明,相对于最先进的模拟和真实机器人数据,TD 校准可以提高性能。有趣的是,我们表明,当使用 TD 进行校准时,VLA 的单步动作概率可以产生有竞争力的不确定性估计,这与最近采用不同校准技术的发现形成鲜明对比。