论文

模仿者游戏:超越动作预测的机器人模仿能力基准测试

The Imitator Game: Benchmarking Robot Imitative Ability Beyond Action Prediction

模型评测基准与评测资源

摘要

人类在意图层面进行模仿:通过演示,我们推断出其目标,并使用手头的任何工具、物体和布局来实现它。当前的机器人策略而是从视觉输入和语言指令中学习观察到行动的映射,而不明确推断所演示的任务。因此,从人类视频中学习很大程度上仍然是轨迹层面的:模型可以在几乎相同的场景中重放动作,但仍然难以模仿演示者的意图,而不仅仅是他们的行为。我们引入了模仿者游戏,这是一个四级基准(L0-L3),它逐渐扩大人类演示和机器人自己的场景之间的差距,隔离轨迹重播不再足够和任务理解变得必要的地方。我们将其与 IG-10K 和 Imitator Arena 配对,IG-10K 是迄今为止最大的环境匹配配对人类机器人数据集,也是唯一一个在真实和模拟设置(20,000 多个配对片段、50 多个任务、6 个域)中跨所有四个级别进行实例化的数据集,以及 Imitator Arena(一个用于盲人 A/B 人类评估的开放平台)。在九个最先进的模型中,从 L0 到 L2 的性能稳定,但在 L3 时崩溃,这表明功能替代(通过不同的对象可供性实现相同的意图)是意图级模仿的决定性障碍。人类视频条件模型的表现优于字幕条件模型,但每个模型在未见过的任务上的零样本成功率都低于 13%; 微调 IG-10K 预训练模型只需 10 美元的配对人机演示即可产生巨大收益,收益随着预训练规模的增长而增长。项目网站和 Imitator Arena 的访问可在 https://imitator-game.github.io 上找到。