论文

PAIQ:通过残余旋转进行补丁对齐语义注入

PAIQ: Patch-Aligned Semantic Injection via Residual Rotation

模型训练参数高效训练

摘要

语言一致和自我监督的视觉编码器在语义抽象和空间细节方面提供了互补的优势。利用这种互补性需要丰富局部特征,同时保留语义相关补丁之间的区别。我们引入了 PAIQ,一种补丁对齐的语义注入框架,它将基于内容的交叉编码器匹配与正交约束残差更新相结合。 PAIQ 使用 DINOv3 补丁特征作为空间基础,通过联合源分配聚合互补的 SigLIP 特征,并通过共享正交变换 Q 注入聚合基础差异。这种旋转适应更新方向,同时保留残差范数和成对角度。对于固定的投影特征,我们推导了相似语义聚合下补丁可分离性的条件,并表明当共享聚合时,旋转在直接插值上添加了非负分离项。仅训练投影和融合参数;视觉编码器和语言模型都保持冻结,融合保留 196 个视觉标记。在不同的语言主干中,PAIQ 在图像描述和视觉问答方面比单编码器接口在评审评估的正确性和幻觉严重程度方面取得了广泛的进步。在 2B 和 9B Qwen 主干上,这个紧凑的接口平均比最强的评估融合或词元压缩基线高出约 2.9 个正确性点。