论文

将语义与失真解耦:用于人工智能生成的图像质量评估的多尺度双流视觉语言对齐

Decoupling Semantics from Distortions: Multi-Scale Two-Stream Vision-Language Alignment for AI-Generated Image Quality Assessment

模型评测评测方法与指标

摘要

现有的基于视觉语言模型(VLM)的人工智能生成图像质量评估(AIGIQA)方法存在基本的语义扭曲维度冲突:针对语义辨别而优化的整体表示本质上将构图理解与底层感知敏感性纠缠在一起,使它们对细粒度的质量下降视而不见。我们引入了 MST-CLIPIQA,一种多尺度双流框架,通过显式表征解耦实现分层视觉语言对齐。我们的架构利用具有互补补丁粒度的双 CLIP 编码器:粗粒度流捕获全局语义一致性,而细粒度流保留纹理签名和工件模式。受信息瓶颈启发的门控融合机制执行自适应跨尺度 蒸馏,并具有可选的交叉注意功能,可在生成提示可用时实现提示锚定对应评估。跨越五个基准的广泛实验建立了新的最先进的结果,在质量上平均提高了 1.11% SRCC,在文本图像对应预测上平均提高了 2.35% SRCC,同时仅用 0.8M 可训练参数保持了效率。我们的项目位于 https://github.com/YMlinfeng/MST-CLIPIQA。