论文

当更快的 VLA 部署改变闭环行为时:跨 PyTorch 和 ONNX 变体的 SmolVLA 任务成功延迟分析

When Faster VLA Deployment Changes Closed-Loop Behavior: Task Success-Latency Analysis of SmolVLA Across PyTorch and ONNX Variants

模型评测模型能力评测

摘要

视觉-语言-动作 (VLA) 部署可以减少推理延迟,同时改变闭环任务行为。我们在 LIBERO Spatial and Object(MuJoCo 3.3.2、LeRobot 0.6.1、seed 42)中的 RTX 2060 (6 GB) 上评估 HuggingFaceVLA/smolvla_libero,将 PyTorch+AMP 与 ONNX 运行时 CUDA 执行提供程序 (CUDA EP) 进行比较。主评价采用100集/套;配对执行轨迹使用 300 集/套件。 PyTorch+AMP 在 1181 毫秒 p99 时达到 70.0%/88.0% 空间/对象成功率。 Requested-FP16 和 requests-INT8 ONNX 将 tether-inspect p99 减少到 601 毫秒和 532 毫秒,而空间成功率下降到 41.0% 和 40.0%,对象保持在 89.0%。图形审核显示这些工件是字节相同的 FP32 图形,因此请求的 INT8 行不是运算符级 INT8 量化。静态语言宽度消融(16/24/32 个标记)产生的空间成功率为 41.0%、75.0% 和 71.0%;宽度 24 和 32 恢复了大部分空间下降,同时对象成功和统一工作台延迟保持大致稳定。 Width-24 ONNX Spatial 的成功与 PyTorch+AMP 基线相当,延迟时间大约为一半(Wilson 区间重叠;二比例卡方 p=0.53)。上下文宽度是该堆栈中的重要贡献者;它并不能解释 PyTorch 与 ONNX 的所有差异。部署评估应联合报告延迟、工件检查、接口约束和闭环成功。代码:https://github.com/rafiqul713/smolvla-libero-onnx。