论文

面向长视野视觉-语言-动作操纵的神经符号程序推理

Towards Neuro-Symbolic Procedural Reasoning for Long-Horizon Vision-Language-Action Manipulation

智能体系统Agent 规划

摘要

视觉-语言-动作(VLA)模型可以执行短期操作技能,但在需要持久任务状态、依赖性感知推理、条件决策和可靠基础的长期程序中仍然很脆弱。我们研究了一种神经符号框架,它将学习的 VLA 控制与显式任务图和多模态程序记忆相结合。任务图对动作依赖性、有效转换和分支条件进行编码,而内存则保留活动步骤、已完成的动作、文本上下文和与任务相关的视觉证据。这些结构共同指导对象选择、目标位置定位、子目标调度以及预期状态转换的验证。人类演示通过凝视或显着性线索提供额外的空间和时间指导。为了隔离它们对 同策略 学习的影响,我们的初步研究绕过了跨视图凝视转移,并直接注释机器人视图遥操作视频中的伪凝视。在 VLA 微调 和推理期间使用生成的指导。我们研究两个长视野操作领域,工作空间清理和手术器械处理,它们需要有序执行、基于视觉的决策和条件分支。我们评估正确的对象和目的地选择、子任务完成情况、任务进度、步骤顺序一致性、完成任务成功以及程序或执行错误。这项工作将结构化符号推理和演示衍生的视觉引导作为可靠的长视野 VLA 操作的补充机制。