论文
DiTTo:可扩展的订单感知一体式图像恢复代理
DiTTo: Scalable Order-aware All-in-One Image Restoration Agent
摘要
现实世界的图像很少遭受单一退化,并且消除退化的顺序会极大地影响最终的恢复质量,从而激发了基于代理的图像恢复(IR),其中视觉语言模型调度了一组预先构建的恢复专家。然而,现有的基于训练的代理需要每个图像 $\mathcal{O}((N^{\mathbf{D}})^{2})$ 恢复专家调用来构建最佳恢复动作轨迹数据集 (ORTD),其中 $N^{\mathbf{D}}$ 表示宇宙 $\mathbf{D}$ 中退化类型的数量,并将代理训练与固定的恢复专家池耦合,防止扩展新引进的修复专家无需经过全面的再训练。为了克服这些效率和可扩展性瓶颈,我们提出了 \textbf{DiTTo},一种新颖的顺序感知图像恢复代理框架,由 DiTTo 模拟器和 DiTTo 代理组成。 DiTTo 模拟器结合了用于单步恢复动作模拟的 $\cup$S-IR 和用于每个动作质量预测的 AiO-IQA,将 ORTD 构建减少到每个图像 $\mathcal{O}(N^{\mathbf{D}})$ 模拟器调用; DiTTo 代理由 SFT 在模拟器生成的 ORTD 上进行训练,然后是 \textbf{Order-aware Restoration Alignment (ORA)},它沿独立轴对齐退化识别、恢复操作排序和输出格式。这实现了即插即用的可扩展性:添加新的恢复专家只需要更新轻量级 ORA 阶段。在具有最多五个并发降级的 MiO-100 评估集上,我们的 DiTTo Agent 在之前基于代理的 IR 方法中实现了最先进的多重降级恢复质量。