论文

当动态发生变化时,稳健的任务推理获胜:重新审视行为基础模型的离线模仿学习

When Dynamics Shift, Robust Task Inference Wins: Offline Imitation Learning with Behavior Foundation Models Revisited

模型训练强化学习

摘要

行为基础模型 (BFM) 通过预训练与任务无关的表示来实现可扩展的模仿学习 (IL),这些表示可以快速适应新任务。然而,现有的 BFM 假设环境动态固定,限制了它们在现实世界变化(例如摩擦、驱动或传感器噪声变化)下的鲁棒性。我们通过将 BFM 任务推理制定为鲁棒的极小极大优化问题来解决这个问题,从而能够在不修改预训练的情况下适应最坏情况的动态扰动。据我们所知,这是第一个基于 BFM 的框架,它在仅依赖于单个名义环境中的离线数据的情况下实现了对动态变化的鲁棒性。我们的方法在动态变化下明显优于标准 BFM 和强大的离线 IL 基线。这些结果表明,可以完全在任务推理时实现稳健的策略,从而提高 BFM 在动态环境中的实用性。