论文

通过双系统VLA的预测不确定性触发通才推理

Triggering Generalist Reasoning via Predictive Uncertainty for Dual-System VLA

模型推理测试时计算扩展

摘要

双系统视觉-语言-动作 (VLA) 模型通过将缓慢的、具有推理能力的通才与快速的专业行动专家配对来改进实时机器人控制。然而,现有方法以固定频率调用通才,忽略了决策复杂性在整个执行轨迹中变化的事实。这种静态策略会浪费简单阶段的计算,并且在场景意外变化时会延迟重新推理。我们提出 TUD(通过双系统VLA的预测不确定性触发通才推理),这是一种自适应推理框架,可以选择性地跳过不必要的通才调用。 TUD 测量缓存通才上下文下即将到来的块槽的动作重新预测的跨步离散度,作为预测不确定性信号。该信号捕获随着新观察的到来,未来行动计划的变化程度,并根据架构已经运行的前向计算,既不需要手动阶段标签,也不需要辅助不确定性模型。在VLA-Arena 上,它在匹配呼叫预算方面比替代不确定性基线实现了更高的成功率,同时保持较低的挂钟开销,并且更一致地将成功与失败的执行轨迹区分开。此外,TUD 发现了比非自适应基线更有利的成本与成功权衡,当单个阈值变化时跟踪整个操作曲线,并以匹配的成功率大幅减少VLM调用。同样的权衡也出现在我们的真实机器人实验中,相对于最强的固定间隔基线,TUD 将通才呼叫减少了 75%,同时实现了更高的成功率。我们的结果表明,预测不确定性为有效VLA控制中的自适应推理提供了实用标准。

通过双系统VLA的预测不确定性触发通才推理的原论文方法或结果图
图 2:TUD 概述。通才调用在决策点刷新缓存的上下文 $h_{k}$,专家向前在每一步根据 $h_{k}$ 重新预测动作块,这些重新预测的滑动缓冲区产生预测行动计划离散度 $u_{t}$。调用规则对 $u_{t}$ 的运行平均值进行阈值以跳过或调用通才。