论文
能量引导是否足够?无需训练的驾驶世界模型规则注入
Is Energy Guidance All You Need? Training-Free Norm Injection for Driving World Models
摘要
大型视频扩散骨干的驾驶世界模型能够生成逼真场景,却难以控制;施加交通规则通常需要重训或手工布局条件。论文检验能否不用训练实现控制。实验表明,联合生成未来视频与本车规划轨迹的整流流世界模型,可在采样时利用编码驾驶规则的可微能量函数调整规划轨迹,无需对扩散骨干进行特定知识再训练。 基于Open-Sora 2.0 MM-DiT骨干的实验中,采样阶段注入能量引导可使模型在反事实目标位置制动。但生成的视频尚未通过骨干的联合自注意力跟随调整后的轨迹。作者据此指出,视频流与轨迹流之间的耦合,是实现端到端可控世界展开的必要环节。