论文
Video2STL:为机器人学习奠定 VLM 生成的时间规范
Video2STL: Grounding VLM-Generated Temporal Specifications for Robot Learning
摘要
基于视频的策略学习特别有前途,因为它可以说明目标行为,而不需要动作注释或实施例匹配的演示。一个核心挑战是决定哪些信息应该从视频传输到机器人。现有的方法通常将视觉观察转换为标量相似性或价值信号,或者要求基础模型直接生成奖励代码。这些方法可能会使任务的时间结构难以检查、基础和重用。我们提出了 Video2STL,这是一个框架,可将仅观察的视频转换为参数信号时序逻辑 (STL) 规范,并使用生成的形式表示进行机器人学习。视觉语言模型提取独立于实施例的语义事件轨迹并构建符号时间规范库。该模型确定任务结构,而数值谓词阈值和时间界限则基于成功的机器人轨迹。对于策略学习,我们将短时间尺度和长时间尺度的时间信息分开:短时间范围规范通过滚动窗口定量鲁棒性提供密集奖励,而保留的长时间范围规范上的因果监视器为有效时间前缀提供一次性进度奖励。相同的表示支持从人类或动物视频到机器人控制的跨实体传输。在四个操作任务中,Video2STL 的平均一次成功率为 $85.8\%$,最终成功率为 $67.0\%$,而原生密集 PPO 的平均成功率为 $81.5\%/59.5\%$,Text2Reward 的平均成功率为 $65.0\%/42.3\%$;在四足运动中,基于 Qwen-3.8 和 GPT-5.6 的 Video2STL 策略在 $0.3$ 到 $2.1\,m/s$ 的速度范围内取得了 $100\%$ 的成功,同时在高速能源效率方面保持竞争力。项目网页:\href{https://video2stl.github.io/}{video2stl}.