论文

HumanoidVLN:基于物理的模拟器和跨不同人形实施例的视觉语言导航的基准

HumanoidVLN: A Physics-Grounded Simulator and Benchmark for Vision-Language Navigation Across Diverse Humanoid Embodiments

智能体系统Agent任务评测

摘要

人形机器人的视觉语言导航(VLN)提出了现有基准无法解决的挑战:双足运动施加了轮式​​代理所没有的物理约束,人形形态在不同平台上有所不同,并且以自我为中心的观察因运动引起的相机动态而扭曲。我们提出 HumanoidVLN,一个基于物理的模拟器和跨不同人形实施例的 VLN 基准。我们的平台基于 NVIDIA Isaac Sim 构建,支持一组可扩展的人形配置,并通过将强化学习运动策略与可互换 PD 或 MPC 路径跟踪器相结合的分层控制堆栈,在跨越 10-12 个下半身 DoF 和高度从 1.17m 到 1.80m 的四个机器人(Unitree G1、Unitree H1、Internal-A、Internal-B)上进行了演示。新的机器人和 VLN 模型可以轻松集成;我们展示了与 NaVILA、DualVLN、StreamVLN 和 JanusVLN 的兼容性。环境取自艺术家设计的场景和 3D 高斯泼溅重建,并针对超过 100 平方米的可导航区域进行过滤。指令由双生成器-审阅器加释义器多代理管道生成,并具有人机循环验证,产生 933 个碰撞感知参考片段,每个片段都配有一条细粒度指令和三种粗粒度风格变体(正式、自然、休闲)。在四个模型和四个实施例中,JanusVLN 实现了 43.55% 的最高平均成功率和 48.38 的 nDTW。在使用 DualVLN 和 Unitree G1 的 20 集模拟真实飞行员中,导航误差密切相关 (r=0.935),平均绝对差为 0.68m,平均轨迹相似度为 0.782 (+/-0.188) nDTW。这些结果强调了物理执行下 VLN 模型、控制器和人形实施例之间的交互。代码、基准测试和数据将在接受后在 https:// humanoid-vln.github.io/ 上发布。