论文
压缩人工智能流量:分裂视觉语言推理中视觉词元表示的标准化神经网络编码
Compressing AI Traffic: Standardized Neural Network Coding of Visual-Token Representations in Split Vision-Language Inference
摘要
当视觉语言模型(VLM)的视觉编码器和语言解码器在不同的计算节点上运行时,中间视觉词元嵌入成为通信的有效负载而不是内部激活。我们将这种机器消耗的中间张量称为人工智能流量,并询问使用标准化的 无需训练 编解码器可以将它们压缩到什么程度。我们在 Qwen3-VL-8B-Instruct 视频问答管道的完整可视界面上插入 ISO/IEC 15938-17 神经网络编码 (NNC) 往返,包括主要视觉标记表示和 DeepStack 特征流,同时保持权重、提示和生成不变,并在较宽的速率范围内扫描量化参数 (QP)。封闭式视频 MME 精度保持接近未压缩参考,传输的 BF16 张量最多减少 98%,然后才崩溃;开放式 MLVU 生成在 LLM 判断下显示出相同的稳定和崩溃曲线。这种鲁棒性并不是由于近乎无损的重建:解码的张量是高度离散的,带有大量的行方向相对 L2 误差,并且具有比其源明显更陡的奇异值衰减。因此,下游推理取决于粗略结构和相对几何形状,而不是精确的浮点值,这支持人工智能流量编解码器的速率任务而不是速率失真优化。