论文

CAPABLE:通过行为潜在编码进行能力感知策略适应

CAPABLE: Capability-Aware Policy Adaptation via Behavioral Latent Encoding

模型训练模型评测强化学习参数高效训练鲁棒性、公平性与可信度评测

摘要

视觉-语言-动作(VLA)策略采用它们所训练的实施例,并且当联合故障改变命令动作的物理执行方式时,可能会失败。现有的故障恢复方法通常需要特定于任务的再训练、故障标签、显式诊断或特权实施例信息。我们引入了 CAPABLE,这是一种针对冻结 VLA 的统一能力感知适应框架,它将自监督能力推理与残差强化学习相结合。 CAPABLE 使用跨关节共享的时间编码器、雅可比基础、跨关节注意力和自监督物理预测,从命令响应历史和运动学在线推断能力、每个关节实际实现的命令运动量以及该运动如何影响末端执行器行为。由此产生的表示条件是剩余策略,该剩余策略向 VLA 臂动作添加有界校正,而无需故障标签或故障关节标识符。在 28 项 LIBERO 任务中,CAPABLE 将排除故障训练的执行器的成功率从 24.8% 提高到 59.3%, 比参数匹配的全球历史基线高出 17.4 个百分点,同时保持健康的表现。六个关节的留一执行器实验表明,这种转移并不特定于一个执行器,并且额外的评估描述了向看不见的故障族转移的特征,并证明了在实体 Franka Panda 上的恢复。https://capable-vla.github.io/