论文
用于多维图像恢复的预训练低秩张量分解
Pre-Trained Low-Rank Tensor Decomposition for Multi-Dimensional Image Recovery
摘要
最近,张量分解在多维图像表示中很流行,它从头开始学习每个图像的特定于实例的结构。然而,张量分解忽略了不同图像之间的共同结构,导致语义建模能力有限、计算成本高和大量可学习参数。为了应对这一挑战,我们提出了第一个预训练的低秩张量分解(PLTD)框架,它将预训练的大视觉模型有机地集成到经典的张量分解框架中。除了浅层和未经训练的深层张量分解之外,所建议的 PLTD 在更高的恢复保真度、更少的可学习参数和更小的碳足迹之间实现了前所未有的平衡。具体来说,PLTD 将目标张量分解为潜在张量和将潜在张量映射回原始数据域的可学习变换。潜在张量由两个不可或缺且互补的术语组成,即固定的预训练潜在张量和可学习的低秩潜在张量。固定的预训练潜在张量是从预训练的大视觉模型(即 DINOv3)中提取出来的,以捕获目标张量的共同结构,而可学习的低秩潜在张量则表征目标张量的实例特定结构。为了检验 PLTD 的潜力,我们开发了相应的多维图像恢复模型,并从理论上证明了该框架的优势。此外,我们还讨论了 PLTD 和经典张量分解框架之间的联系。多维图像恢复的大量实验表明,与最先进的方法相比,PLTD 始终能够实现卓越的性能。