论文
您不需要留在循环中:用于改进机器人策略的代理机器人循环
You Don't Need To Stay in The Loop: An Agentic Robotics Loop for Robot-Policy Improvement
摘要
编码智能体(例如 Claude Code 和 Codex)关闭了软件循环:主代理管理循环,子代理分析和执行,工具完成工作。我们将此架构移植到机器人策略改进中,其中一个差异主导了设计:机器人工具(训练有素的策略、训练管道、数据收集)经常失败,因此必须测量工具的质量,在每次调用时进行记录,并在其背后的工件发生变化时过期。 AgenticRobotics 是一个独立于后端的控制平面,其中 LLM 控制器通过持久的训练-评估-改进事务来驱动一次性工作人员:不可变的目标、控制器拥有的测量、提交密钥的崩溃恢复、证据分级的技能库以及具有标准化、记录的调用表面的工具注册表。标题是一个操作声明,而不是一个选择声明:操作员可以离开,因为升级是有证据控制的,状态是可恢复的,并且能力质量是从记录中得出的——而不是因为循环选择了比人类更好的检查点;在我们测量的一个谱系上,情况并非如此。这些门可显着购买虚假促销控制(每次运行 0.001 次强化,而每次运行 0.005--0.021 次交付)、可选停止下的任何时间有效决策、杀戮注入下的零丢失或重复效果,以及由签名验证者捕获的六个工件篡改类别中的六个。