论文
VisualThink-VLA:有效且低延迟的视觉-语言-动作策略的视觉中间推理
VisualThink-VLA: Visual Intermediate Reasoning for Effective and Low-Latency Vision-Language-Action Policies
摘要
最近的工作已经开始为视觉-语言-行动(VLA)政策配备明确的中间推理。然而,在具体控制中,文本思想链不太适合:不相关或弱的文本信息可能会干扰动作预测,而自回归文本解码会为实时闭环执行增加太多延迟。我们提出了 VISUALTHINK-VLA,这是一个用于准确、低延迟 VLA 策略的视觉中间推理框架。我们的引导理念是通过有效的视觉思维来指导行动:VISUALTHINK-VLA 通过紧凑的视觉证据界面引导行动预测,该界面保留空间精度,同时避免解码开销。此外,为了进一步提高性能和效率,VISUALTHINK-VLA采用量身定制的选择性路由机制来学习视觉证据标记,在保持高容量专业化的同时实现低延迟推理。我们还引入了 VisualEvidence-Kit,这是一种以 VisualEvidence-Agent 为中心的监督和审计资源,它构建了 754.7k VLA 指令 VisualEvidence-Set,用于路由监督和反事实 忠实性 测试。在多个基准测试和真实机器人评估中,VISUALTHINK-VLA 在大多数基准测试中实现了最高的成功率,同时将推理增强基准的多秒延迟降低到亚秒级。例如,在 BridgeData V2 上,它将步骤延迟从 ECoT 的 8.377 秒减少到 0.367 秒,实现了 22.8 倍的加速。