论文

TAVIS:模仿学习中以自我为中心的主动视觉和预期凝视的基准

TAVIS: A Benchmark for Egocentric Active Vision and Anticipatory Gaze in Imitation Learning

模型评测基准与评测资源

摘要

主动视觉(即政策在操纵过程中控制自己的视线)已成为模仿学习的关键能力,多个独立系统在过去一年中展示了其优势。然而,没有共同的基准来比较方法或量化主动视觉的贡献、对哪些任务类型以及在什么条件下的贡献。我们引入了 TAVIS,用于主动视觉模仿学习的评估基础设施,具有两个互补的任务套件——TAVIS-Head(5 项任务,通过云台进行全局搜索)和 TAVIS-Hands(3 项任务,通过腕部摄像头进行局部遮挡)——基于 IsaacLab 构建的两个人形躯干实施例(GR1T2、Reachy2)。 TAVIS 提供了三种评估原语:相同演示上的配对头摄像头与固定摄像头协议; GALT(凝视行动前置时间),一种基于认知科学和 HRI 的新颖指标,可量化学习政策中的预期凝视;以及程序 ID/OOD 分割。扩散策略和 $π_0$ 的基线实验表明 (i) 主动视觉通常有帮助,但好​​处是视任务条件而定,而不是统一的; (ii) 在两个套件的受控分配变化下,多任务策略急剧退化; (iii) 仅模仿就会产生预期的凝视,其中位交付时间与人类远程操作员的参考相当。代码、评估脚本、演示(LeRobot v3.0;约 2200 集)和经过训练的基线在 https://github.com/spiglerg/tavis 和 https://huggingface.co/tavis-benchmark 上发布。