论文
WIZARD:生成LoRA权重以适配机器人新任务
Robotic Policy Adaptation via Weight-Space Meta-Learning
摘要
视觉-语言-动作(VLA)模型正在成为一种有前景的机器人操作范例,能够从大量演示和动作标签中训练出通用策略。然而,使这些模型适应新任务通常仍然需要特定于任务的演示、操作注释和额外的 微调,使得部署成本高昂且难以扩展。我们提出了 WIZARD,一种权重空间元学习框架,通过为冻结的 VLA 策略生成特定于任务的 LoRA 参数来避开特定于任务的 微调。仅给定语言指令和简短的演示视频,WIZARD 即可在单次前向传递中预测相应的适应权重,无需目标任务动作标签或测试时优化。在元训练期间,WIZARD 学习将任务证据直接映射到专家 LoRA 更新,捕获权重空间中任务之间的关系。 LIBERO 上的实验表明,WIZARD 在未见过的数据集集合上将性能最高改善约2倍,在未见过的任务上将性能最高改善约14倍。在 Franka Emika Panda 上,WIZARD 持续改进了真实域适应基线,表明生成的适配器提供了超越模拟的任务级专业化。