论文
RIG-RoPE:具有实例局部旋转几何和表示感知遍历坐标的关系分层多模态注意力
RIG-RoPE: Relation-Stratified Multimodal Attention with Instance-Local Rotary Geometry and Representation-Aware Traversal Coordinates
摘要
多模式旋转位置编码将时间、高度和宽度相位应用于交错的文本、图像和视频标记。这会产生两个歧义:除非声明注册,否则跨实例空间位移取决于预处理图表选择,并且跨视觉块的标量前进通常是从坐标极值继承的,而不是在表示级别定义的。我们引入了 RIG-RoPE,结合了实例局部旋转几何、关系分层注意力和表示感知遍历坐标。 RIG-RoPE 分别对关系同质分数进行归一化,使用常见的 H/W 中性 LogSumExp 统计量分配质量,并使用在有序切片上累加和在平行空间尺度上次线性的遍历范围。文本按单位增量前进,图像块是同时进行的,视频在分词器时间标记上累积。在匹配的仅推理 Qwen2-VL-2B 检查点实验中,本机路径和 RIG 仅文本路径完全相同。 RIG 对于整个图表单图像翻译以及仅翻译未配准图像对的第二个实例来说是完全不变的。原生注意力对后者仍然敏感,而 H/W 崩溃控制证实 RIG 保留了相同实例的空间效应;视觉嵌入和所有参数均未更改。在冷冻小型任务的三个种子中,RIG 的清洁至规格 logits 变化也为零,而每个种子的原始 H/W 基线都发生了变化。仪表精度差异为+2/72、0 和0,未通过预先注册的稳定性门。这些结果支持指定的激活和规范机制,而不是稳定的任务改进、普遍性或经验优越性。