论文

AceTone:桥接单词和颜色以进行条件图像分级

AceTone: Bridging Words and Colors for Conditional Image Grading

应用与实践内容创作

摘要

颜色影响我们如何解读图像风格和情感。以前的颜色分级方法依赖于补丁式重新着色或固定滤波器组,难以概括创意意图或符合人类审美偏好。在这项研究中,我们提出了 AceTone,这是第一个在统一框架内支持多模式条件颜色分级的方法。 AceTone 将分级制定为生成式颜色转换任务,其中模型直接生成以文本提示或参考图像为条件的 3D-LUT。我们开发了一个基于 VQ-VAE 的标记器,它将 $3\times32^3$ LUT 向量压缩为 64 个离散标记,保真度为 $ΔE<2$。我们进一步构建了一个大型数据集 AceTone-800K,并训练视觉语言模型来预测 LUT 标记,然后通过强化学习来使输出与感知保真度和美观性保持一致。实验表明,AceTone 在文本引导和参考引导的评分任务上均实现了最先进的性能,与现有方法相比,LPIPS 提高了 50%。人类评估证实,AceTone 的结果视觉上令人愉悦且风格一致,展示了一条通向语言驱动、审美一致的颜色分级的新途径。