论文
网络高效的世界模型词元流
Network-Efficient World Model Token Streaming
摘要
生成驾驶世界模型依赖于紧凑的潜在状态表示,这些表示必须在分布式计算和互联车辆之间有效传输和同步。我们研究离散世界模型状态的网络高效流,其中 stride-16 VQ-U-Net 标记器(码本大小 8,192)将每个 288x512 帧映射到标记 ID 的 18x32 网格(576 个标记/帧),相当于固定长度编码下的 936 字节/帧。我们考虑了严格的每消息有效负载预算和数据包丢失下的关键帧-增量协议,并提出了一种完全在线、无标签的算法,该算法通过码本嵌入空间中的余弦距离优先考虑增量更新,并使用汉明漂移阈值自适应地触发关键帧。自适应算法在匹配的比特率下持续改进周期性关键帧的速率失真边界:在 0.024 Mb/s(200 字节预算)时,纯动态嵌入失真从 0.0712 下降到 0.0661 (7.2\%),在 0.036 Mb/s(400 字节预算)时,从 0.0427 下降到 0.0407 (4.8\%)。在 200 字节的 10\% 增量数据包丢失情况下,纯动态失真为 0.0757,而匹配的周期基线为 0.0789。为了将状态保真度与世界模型的实用性联系起来,我们训练了一个轻量级的下一个词元预测器,并评估了以流式接收器状态为条件的困惑度:在 0.024 Mb/s 时,动态位置困惑度从 206.0 提高到 193.1 (6.3\%),在 0.036 Mb/s 时从 158.9 提高到 155.6 (2.1\%)。这些结果支持离散词元状态流作为带宽感知同步的实用系统层,并在车辆网络限制下改进下游词元动态实用性。