论文

TDDN:用于理解谜题的文本对齐扩散 DINO 网络

TDDN: Text-aligned Diffused DINO Network for Puzzle Understanding

模型训练预训练

摘要

结构化视觉推理(例如图像谜题)需要细粒度的视觉感知,而这是当前视觉语言模型(VLM)所缺乏的能力。建立在基于 CLIP 的 ViT 主干上的 VLM 用细粒度细节换取高级语义,我们表明这种损失会向下游传播。为了恢复它,我们将 DINOv3 和 CleanDIFT 表示融合到感知编码器 (DiffusedDINO) 中,并将其与 RoBERTa-L 对齐,生成一个文本对齐模型 TDDN,它保留了这种感知优势:在冻结主干和仅 $\sim$590K 对齐对的情况下,TDDN 在图像文本检索方面与 CLIP 相匹配,在四项设置中的三项上超过了它。尽管 CLIP 拥有庞大的训练语料库,但它的密集预测精度却是 CLIP 的三倍多(ADE20K 5.20 $\to$ 18.11 mIoU,COCO-Stuff 7.35 $\to$ 24.44)。 TDDN 在通用对比编码器(包括 SigLIP$\,$2)的分割基准上处于领先地位。我们进一步介绍了 Puzzle Perception,这是一个分割和视觉问答数据集,可探索细粒度的空间理解,在该数据集上,TDDN 将 CLIP 的分割精度提高了一倍(11.04 $\to$ 22.51 mIoU)。