论文
Mag-VLA:用于双手磁驱动微型机器人操作的视觉-语言-动作模型
Mag-VLA: Vision-Language-Action Model for Bimanual Magnetically Actuated Microrobot Manipulation
摘要
磁驱动微型机器人已被用作微型无线、非接触式操纵工具,使其在微创应用中具有广阔的前景。然而,由于间接驱动、有限的传感和非线性磁相互作用,它们的控制仍然具有挑战性。在这项工作中,我们提出了 Mag-VLA,这是一种视觉-语言-动作 (VLA) 模型,用于灵巧的磁性微型机器人操作,使用两个安装有磁铁的机械臂来构建动态磁场。双手协调可以实现诸如微型机器人重新定向之类的功能,而单臂很难或无法实现这些功能,但它也带来了耦合控制挑战,因为该策略必须为共享工作空间内的两个执行器生成协调的轨迹。我们的框架使用低秩适应(LoRA)来适应 Qwen2.5-VL-7B 主干,以处理视觉观察和语言指令以进行动作预测。为了捕获任务进展,我们引入了运动感知阶段分类器和阶段条件动作分块 Transformer (ACT) 解码器,用于时间连贯的多步控制。我们进一步构建了一个涵盖三种任务配置的遥控磁性微型机器人操作数据集。消融研究表明,基于 ACT 的解码器的性能大大优于替代的生成动作头。在真实的机器人实验中,Mag-VLA 在所有任务中实现了 90% 的接近成功率,并且随着任务难度的增加,运输成功率分别达到 80%、70% 和 50%。这些结果表明,分层 VLA 建模为磁性微型机器人操作提供了一个有前途的框架。