论文
MIM-VLA:以夹爪电机反馈学习物理交互表征
MIM-VLA: Learning Physical Interaction Representations from Gripper Motor Feedback
摘要
视觉-语言-动作(VLA)策略主要从视觉观察和机器人状态推断抓取动作,但不明确表示接触后观察到的物理反应。我们提出了 MIM-VLA,一种基于电机反馈的架构,它将最近的夹具电流、位置、速度和信号有效性编码为 128 维交互 token。仅电机电机交互模块 (MIM) 使用人工审查的接触和交互阶段标签进行预训练,然后仅调节 SmolVLA 的抓手动作路径;手臂动作和位置控制接口保持不变。相同的 token 支持 MEM 选择器 VLM,该选择器比较候选交互并生成证据条件的选择和解释。我们在三种现实环境中评估 MIM-VLA:比较视觉上不同对象的交互阻力,通过主动探测消除视觉上相似的真实对象和复制对象的歧义,以及轻轻地抓住易碎对象,包括 保留测试 实例。在 13 个对象对中,MIM-VLA 在 75.0% 的试验中选择了较高电阻的对象,而 SmolVLA 基线的这一比例为 48.8%。对于评估的任务,该方法使用夹具已有的电机反馈,不需要额外的触觉阵列、力-扭矩传感器、校准的力估计或直流控制。
