论文
正确计划,然后严格计划:用于高效具身推理的符号强化学习
Plan Right, Then Plan Tight: Symbolic RL for Efficient Embodied Reasoning
摘要
具身任务规划要求代理将自然语言指令转化为物理场景中可执行的动作序列,并且是家庭、辅助和服务机器人的构建块。最近基于提示和强化学习的规划器生成流畅的动作文本,但缺乏廉价的确定性检查来验证生成的计划在目标世界中是否有效,而高保真度模拟太慢而无法用作内循环训练信号。因此,普遍的问题是如何在不依赖字符串级匹配或完全模拟的情况下为实体规划者获得可验证的监督和奖励。在这里,我们展示了从开放世界视频证据或策划任务自动构建的单个 BDDL 规范可以作为数据构建、计划验证和奖励设计的共享接口。视频到 BDDL 解析器、LLM 验证器和轻量级符号引擎共同以毫秒延迟提供密集反馈。我们进一步引入了 GroupAdapt,这是一种困难感知长度计划,它使用批量组通过率作为零成本信号,以便硬提示获得更宽的长度容差,并随着通过率的提高而自动收紧。在提议的验证程序和 GroupAdapt 时间表的指导下,8B 规划器在 BEHAVIOR-1000 上获得了 97.3 的严格通过分数,比 Qwen3-8B 基线提高了 25.9%。这一结果超出了最强的大型模型基线 3.5%,同时将响应长度压缩了 79% 至 207 个标记,展示了有效性和效率。