论文
基于神经符号反事实推理的跨域演示到代码生成
Cross-Domain Demo-to-Code via Neurosymbolic Counterfactual Reasoning
摘要
视觉语言模型(VLM)的最新进展使视频指令机器人编程成为可能,允许智能体解读视频演示并生成可执行控制代码。我们将视频指令机器人编程形式化为跨域适应问题,其中演示与部署之间在感知与物理上的差异会导致流程失配。然而,当前 VLM 缺乏在此类域偏移下重新梳理因果依赖、实现任务相容行为所需的流程理解能力。我们提出 NeSyCR,一个神经符号反事实推理框架,能够对任务流程进行可验证的适应,提供可靠的代码策略合成。NeSyCR 将视频演示抽象为捕捉底层任务流程的符号轨迹。给定部署观测,它推导出揭示跨域不兼容性的反事实状态。通过带可验证检查的符号状态空间探索,NeSyCR 提出能恢复与演示流程相容性的流程修订。NeSyCR 的任务成功率比最强基线 Statler 提升31.14%,在仿真与真实世界操作任务上均展现出稳健的跨域适应。
