论文
RynnValue:利用时间距离缩放机器人价值基础模型
RynnValue: Scaling Robotic Value Foundation Models with Temporal Distance
摘要
通用奖励模型日益成为扩展机器人学习的瓶颈,但从大规模异构语料库中学习价值相关能力的方法仍未得到充分探索。现有的方法将监督与任务内部锚点(例如偏好或标准化进度)联系起来,而这些锚点都不能在实施例和数据源之间干净地转移。我们引入了 RynnValue,一种用于机器人操作的开源价值基础模型,它用时间距离(从观察到语言指定目标的定向成本)取代这些锚点。由于时间距离标签可以直接从时间戳导出,RynnValue 可以扩展到超过 7,000 小时和大约 300 万个指令调节的剪辑,而无需偏好或进度注释。为了使时间值学习在规模上可靠,我们结合了随机时间采样、时间顺序洗牌和值隔离注意力,抑制了使预测对失败和回归不敏感的捷径。在没有偏好标签的情况下进行训练,RynnValue 在 RBM-EVAL-OOD 上获得了 0.704 的平均 Kendall $τ_a$,超越了完全偏好监督的现有技术水平 (0.655),并且是仅进度对应项 (0.292) 的两倍多,同时将零样本推广到未见过的任务、实施例和观点。作为零样本奖励模型,RynnValue 服务于一系列下游应用。通过基于潜力的塑造转化为密集奖励,将现实世界的政策成功率从线上的 52.5% 提高到 72.5%,线下从 63.8% 提高到 82.5%;用于数据过滤,将多任务行为克隆成功率从35.0%提高到42.5%;并用作推理时间价值指导,它将冻结策略的成功率从 67.5% 提高到 80.0%。这些结果将时间距离确立为通用机器人策略的可扩展监督目标和实用奖励界面。