论文

通过全局-局部自适应交互释放视觉 Transformer 在图像质量评估中的潜力

Unleashing Vision Transformer Potential In Image Quality Assessment via Global-Local Adaptive Interaction

模型训练参数高效训练

摘要

在盲图像质量评估(BIQA)领域,由于自然环境中存在多样化且复杂的失真,准确预测真实失真图像的感知质量仍然具有很高的挑战性。尽管现有方法已经取得了显着的准确性,但其可扩展性往往受到主观注释的高成本和可用数据集大小的限制。大规模预训练视觉模型的最新进展引入了强大的语义和表示能力,但它们在 IQA 任务中的应用受到大量计算需求和次优 微调 效率的阻碍。为了克服这些限制,我们引入了全局局部交互适配器(GLIA),这是一种新颖的框架,通过双流特征提取机制与交互式全局局部融合相结合,有效地利用预训练的 Vision Transformer。通过共同保留全局语义信息和细粒度的局部细节,我们的方法提供了卓越的预测准确性和鲁棒性,同时需要显着减少的可训练参数。对多个基准的广泛实验验证了我们方法的有效性和优越性。