论文

ReconVLA:用于机器人控制的不确定性引导和故障感知视觉-语言-动作框架

ReconVLA: An Uncertainty-Guided and Failure-Aware Vision-Language-Action Framework for Robotic Control

模型推理推理验证与自校正

摘要

视觉-语言-动作(VLA)模型已经成为通用机器人控制器,能够将视觉观察和自然语言指令映射到连续的动作序列。然而,VLA 没有为其行为预测提供经过校准的置信度衡量标准,因此限制了它们在必须预见不确定性和故障的现实环境中的可靠性。为了解决这个问题,我们引入了 ReconVLA,这是一种可靠的共形模型,可以产生不确定性引导和故障感知的控制信号。具体来说,我们的方法将保形预测直接应用于预训练 VLA 策略的动作词元输出,产生与执行质量和任务成功相关的校准不确定性估计。此外,我们将共形预测扩展到机器人状态空间,以在故障发生之前检测异常值或不安全状态,提供一种简单而有效的故障检测机制,补充动作级别的不确定性。我们在不同操作任务的模拟和真实机器人实验中评估 ReconVLA。我们的结果表明,保形动作预测持续改善失败预期,减少灾难性错误,并提供校准的置信度测量,而无需重新训练或修改底层 VLA。