论文
RoboInter1.5:用于具体世界建模和机器人操作的整体中间表示套件
RoboInter1.5: A Holistic Intermediate Representation Suite for Embodied World Modeling and Robotic Manipulation
摘要
现有的机器人数据集的管理成本仍然很高,且特定于具体实施例,并且没有充分注释通用推理、执行或长期环境动力学模拟所需的细粒度结构。在我们之前的工作 RoboInter1.0 的基础上,我们推出了 RoboInter1.5,这是一套用于机器人操作和具体世界建模的扩展且整体的中间表示。 RoboInter1.5 提供了以密集操作为导向的中间表示为中心的统一数据、基准和模型资源。具体来说,RoboInter-Data 包含跨越 571 个场景的超过 23 万个操作片段,每帧都有密集的注释,涵盖十多种类型的中间表示,包括子任务、原始技能、物体与夹爪定位、分割、可供性、抓取姿势、接触点、运动轨迹等。基于这些注释,RoboInter-VQA 引入了空间和时间体现的 VQA 任务来基准测试和提高我们的中间表示推理能力。 RoboInter-VLM。 RoboInter-VLA 进一步研究了这种表示如何通过隐式、显式和模块化的计划然后执行范式有利于行动执行。为了更好地模拟物理世界,我们进一步引入了 RoboInter-World,它利用中间表示作为结构化条件信号来对未来世界状态进行可控预测。广泛的评估表明,RoboInter1.5 为中间表示提供了统一的时空支架。 RoboInter1.5 并没有将中间表示仅仅视为可解释的信号,而是将它们概念化为双向接口,既规范低级动作空间,又限制开放世界物理模拟器的潜空间预测轨迹。