论文
用于语言引导抓取和执行状态监控的物理代理循环
A Physical Agentic Loop for Language-Guided Grasping with Execution-State Monitoring
摘要
遵循语言指令的机器人操纵系统通常以很大程度上单次的方式执行抓取原语:模型提出一个动作,机器人执行它,并且空抓取、滑动、停顿、超时或语义错误抓取等失败不会以结构化方式呈现给决策层。受到使用数字工具的代理中代理循环的启发,我们将语言引导的抓取重新表述为在实际执行状态上运行的边界受控的具身Agent,其中物理动作暴露了明确的工具状态流。我们引入了一个物理代理循环,该循环将未经修改的学习操作原语(抓取和举升)与(i)基于事件的接口和(ii)执行监控层 Watchdog 包装在一起,Watchdog 使用接触感知融合和时间稳定将嘈杂的抓取器遥测数据转换为离散的结果标签。这些结果事件(可选地与抓取后语义验证相结合)由确定性有界策略消耗,该策略最终确定、重试或升级给用户以进行澄清,从而保证有限终止。我们使用手眼 D405 相机在移动操纵器上验证生成的循环,保持底层抓取模型不变,并评估涉及视觉模糊、干扰因素和诱发执行失败的代表性场景。结果表明,显式执行状态监控和有界恢复可实现比开环执行更稳健和可解释的行为,同时增加最小的架构开销。有关源代码和演示,请参阅我们的项目页面:https://wenzewwz123.github.io/Agentic-Loop/