论文
视觉-语言模型智能体间潜在通信的事后稀疏编码
Post-Hoc Sparse Coding of Latent Communication Between Vision-Language Model Agents
摘要
潜空间通信让异构的视觉-语言模型智能体无需将视觉与推理状态序列化为文本即可交换连续表示。Vision Wormhole通过把视觉特征转换为可供另一模型消费的通用潜在表示来实现这一方式,但每条消息无论内容如何都以同样大小的稠密张量传输。因此固定容量的稠密张量未必具有固定的有效信息密度:有些消息可能只用到了可用表示自由度的一小部分。这一观察表明该通信信道可能具有很大的可压缩空间。我们通过对冻结的Vision Wormhole激活拟合事后稀疏自编码器来研究其冗余,并在九个推理基准上测量重建质量、下游效用、特征复用与token级干预。相对于原始的float32传输,每个token含k=4个活跃系数的uint16索引/float16数值稀疏载荷将传输字节减少128倍。在单次运行评估中,七任务非AIME平均准确率从49.85%变为49.77%。拟合出的4096元素字典只用到50个特征,任务级活跃集合的平均成对Jaccard相似度为0.906。这些测量确立了相对原始传输的强事后可压缩性,但尚未把稀疏编码的增量贡献与位置选择、精度降低、低秩结构或SAE优化效应分离开来。这些结果激发了对等载荷比较研究,以及载荷随每条消息实际使用信息自适应的通信机制。