论文
Pre-VLA:执行前运行时验证,实现可靠的视觉-语言-动作和世界模型的采样轨迹
Pre-VLA: Preemptive Runtime Verification for Reliable Vision-Language-Action and World-Model Rollouts
摘要
虽然大型视觉语言动作(VLA)模型和生成世界模型(WM)具有先进的长视野体现智能,但它们的实际部署仍然受到基于学习的动作生成的不确定性的挑战。低质量的操作可能会在执行过程中导致物理故障,或者导致误导性的世界模型采样轨迹以及冗余的渲染成本。为了解决这个问题,我们提出了 Pre-VLA,这是一种统一的运行时验证架构,可以在物理执行或世界模型想象之前执行先发制人的动作有效性评估。 Pre-VLA 利用高效的多模态主干和模态感知池和轻量级双分支头来预测候选动作块的安全置信度和评论家得出的优势分数。为了处理严重的类别不平衡和不稳定的边界决策,我们使用结合焦点分类、优势回归和软阈值校准的多任务目标来训练 Pre-VLA。在部署过程中,双模式抢占式重采样调度程序会过滤低质量的操作,并在有限的计算预算下触发自适应重采样。 LIBERO 基准测试表明,与 RynnVLA-002 相比,Pre-VLA 将四个套件的平均闭环成功率从 30.79% 提高到 37.62%,减少了任务执行步骤,实现每个操作块的平均前向验证时间为 183.9 毫秒,并减少了世界模型部署中的错误累积。