论文

SUN:基于语言的控制到学习到真实策略的持久程序

SUN: Persistent Programs For Language-Grounded Control-to-Learning-to-Real Policies

智能体系统Agent 架构与控制循环

摘要

在长期操纵中桥接基于模型的控制和学习策略一直存在着无声的分歧:控制执行指定的目标,学习将该行为摊销为反应性策略,但现有协议丢弃任务语义,留下手工制作的奖励和偏离控制验证的行为。我们引入语义统一(SUN)程序,类型化的可执行文件,其中几何和接触关系定义一次并编译成一致的模型预测控制(MPC)成本,满意度谓词,强化学习奖励,转换警卫和诊断。我们的夸父系统由大型视觉语言系统驱动,自动从语言和场景语义合成SUN程序,通过MPC筛选可行性,并在训练阶段条件策略的同时保留语义。在九项任务中,夸父取得了 82.03% 的宏观成功率,优于稀疏奖励 (35.67%) 和 Stage-BC (24.75%) 基线。在 8192 路规模下,它每小时生成的成功轨迹时间是人类远程操作的 10.57 倍。每个任务有 500 条轨迹,夸父数据训练 DP3 策略的模拟成功率达到 46.0%(替代方案为 22.4%),在物理 Franka 和 Kinova 机器人上达到 34.7%。这些结果表明,模拟筛选的任务语义可以有效地将控制分摊为稳健的策略,无需演示或手动密集奖励,统一符号规划和数据驱动的执行。