论文

视觉语言机器人操作中用于少镜头泛化的任务原型引导流匹配

Task-Prototype Guided Flow Matching for Few-Shot Generalization in Vision-Language Robot Manipulation

模型架构Transformer

摘要

视觉语言机器人操纵策略可以遵循语义指令,但仅通过几次演示就使它们适应新程序仍然很困难,因为语言未明确规定接触时间、运动阶段、纠正行为和执行风格。本文提出了任务原型引导流匹配(TP-Flow),这是一种几次操作框架,它将支持演示转换为结构化任务原型标记,并使用它们来指导初始流先验和速度场。 TP-Flow 采用对称交叉注意力和可学习查询来提取阶段级原型,参数化任务自适应初始分布,并通过门控自适应归一化注入原型信息。它是通过情景支持查询目标和原型对比正则化进行训练的,因此在训练过程中模拟了小样本适应,同时抑制了干扰信息。在 LEROBOT-ARM-SO101 平台上,TP-Flow 在 1、4 和 6 次射击设置下实现了 66.8\%、79.6\% 和 82.1\% 的成功率,以及 75.5% 的几次 AUC。在 1-shot 中,它比 CFM、Pooled-Demo CFM 和 In-Context Flow 提高了 29.8、14.5 和 9.9 个百分点。它还改进了跨新颖对象转移、目标重组、长视野组合和接触/校正任务的保留目标组泛化。 TP-Flow 通过六个在线原型词元、54.3 毫秒延迟、3.9 GB 峰值内存和 10 Hz 控制速率保持实时执行,同时将噪声支持成功率降低至 6.2%。理论诊断表明,原型距离与动作分布距离一致,自适应先验降低了传输成本,并且门控调制使测量的轨迹偏差保持在导出的 ODE 界限以下。代码存储库省略,以供匿名审查。