论文
体现图灵机:机器人递归自我改进的状态代码
Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement
摘要
大多数机器人策略在控制循环中保留一个模型:VLA 将观察结果映射到操作,而代理工具(例如代理即策略或工具 VLA)在运行时查询 VLM 以进行决策。我们提出了不同的观点:体现世界是一个体现图灵机,其磁带是机器人,环境状态和规则是策略。如果可以准确地表示这种状态,则决策可以完全用代码编写。因此,我们提出仅代码作为策略(COAP):代码根据相机图像和本体感知来测量和跟踪机器人、环境和任务状态,并据此做出每一个决定。相同的代码适用于各个剧集,不同的任务共享一个库,循环中没有 VLM 或 VLA。与VLA和Agent Harnesses相比,我们分析了COAP的三个优点:(i)显式状态:状态可以存储在代码中; (ii)执行:代码使得决策可控,故障灵活恢复,在线运行速度快、成本低; (iii) 可扩展性:新任务重用、继承或扩展共享库,因此功能可以 积累任务。这些优点使 COAP 成为递归自我改进(RSI)的合适媒介:编码代理在闭环中开发库,每次更改都是显式且可控的。在 RoboDojo 的 42 项双手任务中,生成的库在测试时无需模型即可达到 70.24% 的成功率。 COAP 的上限在于决策状态表示的准确程度以及代码逻辑的稳健程度。因此,我们提出 COAP 作为具体任务的新范式;由于它适用于各个情节,因此它还可以作为 VLA 和 Agent Harnesses 的高效数据引擎。