论文

ChunkVLA-AM:增材制造中视觉-语言-动作机器人控制的并行动作分块

ChunkVLA-AM: Parallel Action Chunking for Vision-Language-Action Robot Control in Additive Manufacturing

AI 基础设施模型部署

摘要

视觉-语言-动作 (VLA) 模型统一了视觉感知、语言理解和动作生成,为增材制造 (AM) 的自动化提供了新的机会。然而,增材制造的部署仍然具有挑战性,因为使这些模型适应看不见的机器人实施例成本高昂,而且性能可能会在环境变化时下降。在这项工作中,我们提出了一个在固定增材制造工作单元中的 FAIRINO FR3 机器人上部署 OpenVLA-OFT 的框架。数据管道将单目现实世界演示转换为 OpenVLA 兼容的 TFDS/RLDS 数据集,以支持对 FR3 实施例的适应。在运行时,每个推理请求都会预测 7 维动作的八步块。 FR3 在捕获新观察之前执行每个块开环,从而在块之间提供闭环反馈。该系统采用云边缘架构,其中 FR3 客户端通过 FastAPI 接口将观察结果流式传输到远程推理服务器。在 42 次物理 A 到 B 对象传输试验中,红色和蓝色目标各占一半,系统成功了 39 次(92.9%)。所有这三起故障都发生在最终放置期间,当时释放高度控制不足导致物体倾倒。照明扫描确定了 0-255 等级的低误差亮度范围为 85-125,最低平均空间误差为 95。