论文
LLM-多步机器人操作中地平线感知探索的引导未来假设
LLM-Guided Future Hypotheses for Horizon-Aware Exploration in Multi-Step Robot Manipulation
摘要
多步机器人操纵需要在场景如何演变的不确定性下采取行动,这使得探索和政策适应具有挑战性。我们研究短期、任务一致的未来视频是否可以为控制和强化学习 微调 提供有用的结构化先验。我们通过未来体验调节(FEC)形式化了这个想法,这是一个简单的接口,可以根据未来短视频的潜在表示来调节闭环策略。在我们的模拟设置中,未来剪辑分三个阶段生成:LLM 推理机在从当前场景状态初始化的任务本体上运行,预期对象运动的无机器人数字孪生轨迹采样,以及无掩模视频扩散模型,该模型合成机器人一致的未来剪辑,无需在推理时进行分割。我们主要使用 BC 和 BC+RL 实例化这个未来条件接口,并与 NoFuture、GTFuture、GenFuture 和 WrongFuture 下 RoboCasa 和 CALVIN 上的未来条件流策略 (SFP) 基线进行比较。与无未来条件相比,生成的期货提高了性能,而不匹配的期货则降低了性能,并且我们的 BC+RL 实例化实现了最强的整体结果。 8 个 CALVIN 任务的平均 BC+RL 学习曲线分析进一步表明,GTFuture 进步最快,GenFuture 比 NoFuture 进步更早且水平更高,而 WrongFuture 在整个训练过程中保持为零。这些结果表明,短期未来视频可以作为有用的结构化先验,用于在不完美的未来预测下进行探索和政策适应。 https://enact2026.github.io/