论文

IQA-T1:基于工具的图像质量评估视觉证据推理

IQA-T1: Tool-based Visual Evidence Reasoning for Image Quality Assessment

智能体系统Agent 工具调用

摘要

由于泛化性和可解释性有限,开放世界环境中的图像质量评估 (IQA) 仍然具有挑战性。最近基于多模态 大语言模型 (MLLM) 的方法引入了用于质量预测的文本推理,但它们的判断严重依赖于语义偏差的内部表示,使得它们对低水平的感知退化不敏感。我们提出了 IQA-T1,一种基于工具的视觉证据推理框架,通过明确的感知观察增强 MLLM 推理。在推理过程中,模型自动调用专门的分析工具来生成结构化的视觉证据,例如噪声残差图、梯度统计和频谱,这些证据逐渐集成到推理过程中。为了支持这种范式,我们构建了 Q-Tool,这是一个包含 11k 个多模态推理链的数据集,这些推理链基于工具生成的证据。对七个 IQA 基准的广泛实验表明,IQA-T1 在跨数据集上实现了最佳整体性能,同时生成可解释且基于证据的质量评估。代码和数据集可在 https://github.com/zibuyu-02/IQA-T1 获取。