论文

多模态Transformer中的细化对称性

Refinement Symmetry in Multimodal Transformers

模型架构Transformer

摘要

注意力权重取决于词元计数,词元计数随着信号的表示而变化。我们研究细化对称性:在保留内容、位置、可见上下文和总质量的同时分割表示应该保留其贡献。基于比例和正交注意力,我们表明,分割不变性迫使局部质量因子对于任何固定的正注意力核来说都是线性的,前提是该因子是非递减的。对于变化的表示,物理耦合通过将特征变化与权重重新分配分开来限制注意力误差。在 Qwen2.5-Omni-7B 中,在标准注意力下,复制一半的视觉标记将 3,586 个 MVBench 答案中的 255 个改变三倍;衡量权重在匹配的可见性下保留每个答案。在自然帧重采样下,它减少了分布漂移。在冻结视频编码的双重合并中,五种子评估显示,全分区正确的准确度比全局计数权重(平均组质量)提高了 1.04 个百分点,比标准注意力提高了 0.93 个百分点。 WorldSense 相对于全局计数的优势也存在,但取决于压缩预算。结果是一种表示原则,在跨分区的鲁棒性方面具有可衡量的优势。