论文

Logic-VLA:受时序逻辑约束的视觉—语言—动作模型

Logic-VLA: A Temporal Logic Conditioned Vision-Language-Action Model

模型训练偏好优化

摘要

视觉—语言—动作模型可以遵循自然语言任务指令,但指令未必能精确表达安全关键或时空要求。Logic-VLA在推理时以信号时序逻辑STL规范为条件,使用预训练的语法图编码器捕捉时序逻辑语义。策略适应分两阶段:先在满足规范的示范上进行STL条件监督微调,再对满足与违反规范的配对执行轨迹做轨迹级偏好优化,并用流匹配代理目标实现Identity Preference Optimization(IPO)。该方法改善形式化要求的满足程度,同时保留原自然语言任务。研究在随机化、逼真的四旋翼闭环导航模拟中评估,并测试未见STL公式的泛化。各项基准中,相比不感知STL的基础策略,满足率提高24.8–40.7个百分点,原任务成功率最多下降1.8个百分点,说明单个VLA可适应不同规范,无需为每条规范单独训练策略。