论文

基于神经符号反事实推理的跨域演示到代码生成

Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning

智能体系统Agent 规划

摘要

视觉语言模型(VLM)的最新进展使视频指令机器人编程成为可能,允许智能体解读视频演示并生成可执行控制代码。我们将视频指令机器人编程形式化为跨域适应问题,其中演示与部署之间在感知与物理上的差异会导致流程失配。然而,当前 VLM 缺乏在此类域偏移下重新梳理因果依赖、实现任务相容行为所需的流程理解能力。我们提出 NeSyCR,一个神经符号反事实推理框架,能够对任务流程进行可验证的适应,提供可靠的代码策略合成。NeSyCR 将视频演示抽象为捕捉底层任务流程的符号轨迹。给定部署观测,它推导出揭示跨域不兼容性的反事实状态。通过带可验证检查的符号状态空间探索,NeSyCR 提出能恢复与演示流程相容性的流程修订。NeSyCR 的任务成功率比最强基线 Statler 提升31.14%,在仿真与真实世界操作任务上均展现出稳健的跨域适应。

基于神经符号反事实推理的跨域演示到代码生成:论文配图
图 1:抽屉整理任务场景中 NeSyCR 的概述。 (左)演示和部署之间的域差距插图。 (中)NeSyCR 框架概述,该框架通过神经符号反事实推理生成适应程序。 (右)调整程序的结果,显示 NeSyCR 通过接地代码策略成功执行任务。