论文

Robo-Harness K1:通过感知增强来利用机器人使用代理

Robo-Harness K1: Harnessing Robot-Use Agents via Perception Augmentation

智能体系统Agent 工具调用

摘要

基础视觉语言模型(VLM)理解对象、指令和空间关系,但将这种能力转化为机器人操作仍然很困难。视觉-语言-动作 (VLA) 模型需要大量演示,并且可能会影响预先训练的理解,而直接仅 RGB VLM 控制成本高昂,并且强烈依赖于模型功能。我们介绍 Robo-Harness K1,这是一种机器人使用代理 (RUA) 框架,它将感知公开为工具。代理查询校准的深度、持久的视觉锚点、空间测量和掌握假设,然后从返回的证据中选择通用运动。该接口无需更改 VLM 架构或训练深度编码器即可访问 3D 几何图形。在匹配的 LIBERO-PRO 任务中,配备 K1 的 Gemini 3.7 Flash 准确率达到 77.8%,超过了仅使用 RGB Harness的 GPT-6 Astra 的 61.1%; K1 将 Astra 进一步提高至 88.9%。在没有目标微调的情况下,带有 K1 的 Gemini 会转移到三个 RoboSuite 手臂和双臂 RoboTwin 任务。在 RoboTwin 上,它在 Easy 上达到 32.0%,在 Hard 上达到 28.0%,显示出对视觉和环境扰动的适应能力。 K1 还生成与下一个词元训练一致的工具调用跟踪。仅接受 107 个教师集训练的 Qwen3.5-9B 学生在新初始状态下的准确率达到 44.2%,而 OpenVLA 为 30.2%;在保留任务条件下达到 13.9%,而 OpenVLA 为 0.0%。这些结果表明,感知增强的 RUA 为样本高效、可推广的机器人策略提供了一条有前景的途径,这些策略通过可访问的工具界面利用 VLM 功能。