论文

EyeRobot 2.0:无需腕部相机的主动注视精确操作

EyeRobot 2.0: Active Gaze for Precise Manipulation without Wrist Cameras

摘要

受人类视觉启发,我们提出仅用单个立体相机实现细粒度双手操作的主动注视框架。EyeRobot 2.0通过旋转两个眼睛视点把注视对准场景中的3D注视点。所得图像经中央凹方式处理——给图像中心分配更多视觉token,把计算聚焦到任务相关特征。这种主动视觉固视(AVF)需要任务执行中精心协调的注视,我们分层实现:先训练以目标物体为条件的低层注视伺服策略,再训练基于任务进度发出固视目标的目标选择器。两模块都以真机数据RL训练:前者用稠密几何奖励,后者与BC夹爪策略共同训练——使其能发现类似人类固视序列的任务执行固视序列。EyeRobot 2.0进一步把夹爪信息规范化到注视相对SE(3)系,压缩动作分布的学习尺寸。我们采集7个真机与6个仿真任务的遥操作数据,进行超1000次物理与1800次仿真试验,比较EyeRobot 2.0与同数据训练的被动双目及ego+腕相机策略:去掉腕相机对标准策略代价高昂——仅被动双目真机成功从52%跌至27%;EyeRobot 2.0仅用双目闭合该差距,真机较被动双目高40%、仿真高20%;当腕视图清晰时与ego+腕相当(69%对64%),被抓物体遮挡腕相机时成功率翻倍(48%对22%)。