论文

通过机械可解释性和最优控制将鲁棒性引入世界行动模型

Steering Robustness into World Action Models via Mechanistic Interpretability and Optimal Control

模型评测模型行为与机制分析

摘要

世界行动模型 (WAM) 可以实现语义和物理信息控制,但在分布转移的情况下很脆弱。在这项工作中,我们使用机械可解释性来研究如何在 WAM 激活空间中表示与鲁棒性相关的扰动。比较成功和失败执行轨迹的激活情况,我们发现一些 WAM 架构对于鲁棒性关键特征表现出低维线性可分离性,而其他架构则不然。这促使 无需训练 WAM 转向使用对比激活方向。我们还表明,WAM 激活动力学中的局部线性可通过基于模型的最优控制实现有效的反馈转向,从而产生世界作用线性二次调节器 (WA-LQR),这是一种微创降阶 LQR 控制器。通过机械评估,我们预测 Cosmos-Policy 和 DiT4DiT 模型的可操纵性较强,但 LingBot-VA 的可操纵性较弱,这与转向干预结果一致。在 Cosmos-Policy 和 DiT4DiT 上,WA-LQR 将对比方向推广到新任务,并提高了在无转向和快速转向基线上对相机、夹具和视觉噪声扰动的鲁棒性。