论文

SpatialHarness:用于精细机器人操作的测试时空间脚手架

SpatialHarness: Test-Time Spatial Scaffolding for Fine Robotic Manipulation

智能体系统上下文与知识应用与实践上下文工程Agent Harness机器人

摘要

前沿多模态基础模型(例如 GPT-6 Astra)最近显示出直接机器人控制的巨大潜力,但其在精细操作方面的性能仍然有限。我们认为,失败的一个重要根源不一定是政策能力不足,而是空间可观测性不足,其中现有的物理相机设置可能无法很好地揭示关键任务的空间关系。我们引入了 SpatialHarness,这是一种测试时体现的工具,它为精细的机器人操作提供测试时空间脚手架,而无需进行策略微调或更改物理传感设置。 SpatialHarness 维护与现实世界执行同步的在线模拟场景,识别关键任务的空间关系,并渲染互补的虚拟视图,将它们暴露给冻结的多模式策略。为了在交互过程中保持模拟场景对齐,我们开发了交互感知场景同步,可以区分静态、保持和过渡模式。我们在四个真实的机器人操作任务上评估 SpatialHarness,涵盖精确的任务 几何对齐、对象相对放置以及铰接对象交互。使用相同的冻结 GPT-6 Astra 策略,SpatialHarness 显着提高了任务成功率,包括插头插入从 26.7% 提高到 66.7%,河内塔从 0% 提高到 100%。这些结果表明,提高测试时的空间可观测性可以释放强多模态基础模型中已有的精细操纵能力。项目网站:https://emilia113.github.io/SpatialHarness/.