论文

在世界模型中建模潜在扰动以稳健决策

Modeling Latent Disturbances for Robust Decision-Making in World Models

模型评测鲁棒性、公平性与可信度评测

摘要

在本文中,我们研究了世界模型 (WM) 的 潜空间 中的鲁棒决策。鲁棒优化是一种数学框架,在给定明确指定的动力学和物理上有意义的干扰的情况下,机器人可以选择即使在最坏情况干扰下也保持有效的动作。然而,将这一原理应用于 WM 的学习 潜空间 引入了一个根本性的挑战:因为 WM 已经完全学习了从高维观测推断出的状态空间和动态,所以尚不清楚如何定义忠实代表底层系统中的不确定性的潜在空间扰动。我们的关键思想是将潜在空间扰动建模为对学习到的潜在动态的扰动,从而引发悲观但合理的转变。具体来说,我们通过结合动态感知相似性度量来构建一组合理的潜在动态,该度量捕获合理的转变,并通过分布外检测排除不合理的潜在状态。我们使用共形预测来校准潜在动力学上的这种不确定性,确保由潜在干扰引起的 WM 想象仍然合理,而不会变得过于悲观。然后,我们通过博弈论优化联合优化稳健的机器人动作和最坏情况的潜在干扰。我们利用这种潜在空间鲁棒优化来增强策略转向,考虑两种范例:潜在安全过滤和生成控制策略的采样和验证转向。我们的受控仿真实验表明,我们的潜在干扰能够直接在 WM 潜在空间中进行稳健的决策,而使用 Franka 操纵器进行的硬件实验表明,对潜在干扰进行建模可以实现稳健的策略转向,将安全过滤中的故障减少 70%,将基于采样的策略转向中的故障减少 54%。项目网址:https://junwon.me/LatentDisturbance/.

在世界模型中建模潜在扰动以稳健决策:论文原图
图 3:定性结果:3D Dubins 的汽车。实线表示真实的不安全集边界,红色区域表示每种方法计算的不安全集。 LUCID 非常接近两种不同类型干扰下鲁棒优化的真实不安全集。相比之下,Nominal 过于乐观,而基于采样的基线(例如 WoN 和 CVaR)不能准确地近似不安全集。