论文

因果奖励世界模型:自动技能生成的零样本奖励设计

Causal Reward World Models: Zero-shot Reward Design for Automated Skill Generation

模型训练奖励建模与过程监督

摘要

自动奖励设计(ARD)旨在用语言驱动的奖励函数合成取代强化学习中的手动奖励工程。然而,基于 大语言模型 (LLM) 的现有方法本质上仍然是相关驱动的,依靠迭代环境反馈来完善每个特定任务的奖励假设。这种范式不仅导致推理效率低下,而且还使 LLM 容易受到语义上合理但因果上虚假的奖励成分的影响,从而导致无效的优化。为了解决这些限制,我们提出了因果奖励世界模型(CRWM),它通过多任务交互数据上的离线 预训练 显式地​​建模候选奖励成分和任务目标物理变量之间的因果拓扑关系。基于从粗到细的 预训练 策略,我们引入了一种联合优化模块,该模块将显式机制解耦与置信感知软融合相结合,使用微观轨迹细化粗结构先验,从而构建鲁棒且可解释的因果骨架。在推理过程中,LLM 在限制奖励生成之前利用 CRWM 作为与任务无关的因果关系,从而实现零样本奖励函数设计。我们的工作为 ARD 问题开辟了一个新的白盒范例。对复杂连续控制基准的大量实验表明,CRWM 无需反馈驱动的奖励细化即可生成可执行的奖励函数,显着减少了获取新机器人技能的设计延迟,同时匹配或超越最先进的性能,并进一步在未见过的任务和不同的机器人实施例中表现出强大的泛化能力。