论文

V-CAGE:用于机器人操作的视觉闭环代理生成引擎

V-CAGE: Vision-Closed-Loop Agentic Generation Engine for Robotic Manipulation

模型训练合成数据

摘要

扩展视觉-语言-动作(VLA)模型需要语义一致且物理上可行的大量数据集。然而,现有的场景生成方法往往缺乏上下文感知,难以合成嵌入丰富语义信息的高保真环境,经常导致无法到达目标位置,从而导致任务过早失败。我们提出了 V-CAGE(视觉闭环代理生成引擎),这是一种用于自主机器人数据合成的代理框架。与传统的脚本化管道不同,V-CAGE 作为具身Agent系统运行,利用基础模型将高级语义推理与底层物理交互联系起来。具体来说,我们引入了修复引导场景构建来系统地安排上下文感知布局,确保生成的场景既具有语义结构又具有运动学可达性。为了确保轨迹的正确性,我们将功能元数据与基于视觉语言模型的闭环验证机制集成,充当视觉批评家,严格过滤掉无声故障并切断错误传播链。最后,为了克服海量视频数据集的存储瓶颈,我们实现了一种感知驱动的压缩算法,可以在不影响下游 VLA 训练效果的情况下实现超过 90% 的文件大小减少。通过集中语义布局规划和视觉自我验证,V-CAGE 实现了端到端管道的自动化,从而实现了多样化、高质量机器人操作数据集的高度可扩展的综合。