论文
Kepler-Encoder-v0.1:面向机器人的多模态嵌入模型
Kepler-Encoder-v0.1: Towards a Multimodal Embedding Model for Robots
摘要
机器人必须了解自己身体的状态,但相机只能看到身体的一部分。力和接触在单个帧中几乎不会留下痕迹,原始视觉在我们测试的每个机器人上以 $R^2$ 读取力,等于或低于 $0.10$。我们提出了 Kepler-Encoder-v0.1,这是一种机器人优先的多模态编码器,它将机器人状态视为一种模态,并将视觉、本体感觉和力/扭矩融合到具有学习查询交叉注意层的单个共享潜在层中,并在 LeJEPA/SIGReg 目标下通过屏蔽跨模态预测进行自我监督训练。在评估时只有视觉进入,这提出了一个尖锐的问题。将状态融合到训练中是否会使仅视觉潜伏携带像素尚未包含的任何内容?在 RH20T 语料库上,答案是肯定的,这正是相机最薄弱的地方。在保留的场景中,仅视觉潜伏恢复了末端执行器状态,特别是力,显着高于原始冻结 ViT 特征和每个传感器机器人上的计算匹配的仅视觉控制,尽管单个时间步的绝对力恢复是适度的;在相机主要看到的运动状态上,它在统计上与最强的视觉基线相关,并且它是潜在几何跟踪状态的唯一特征。与实施例无关的单个编码器覆盖四个机器人,并且数据匹配控制显示这种广度反映了实施例多样性而不是数据量。冷冻潜伏期直接有用。它自己的跨模态预测误差是 无需训练 无效状态监视器(超出范围状态的 AUROC $0.90$,场景交换状态的 $0.69$),并且扩散解码器 (PixNerd) 从潜在状态重建相机帧,确认空间压缩保留了世界状态。该报告验证了单时间步的情况;下一步是本机速率时间融合。