论文
让 RGB 成为视觉语言
Let RGB Be the Language of Vision
摘要
这项工作引入了视觉模型的统一公式,其中自然图像之外的各种形式的视觉信息,例如掩模、深度图和其他结构化视觉信号,都表示为 RGB 图像,而一般视觉任务可以转换为常见的 RGB 到 RGB 图像编辑问题。在这种范式中,不同类型的视觉信息在内部共享与自然图像相同的编码和解码架构和参数,使得单个模型能够通过统一的视觉界面跨任务传输,其方式类似于语言模型对文本的操作方式。我们将此公式称为 RGB 输入和 RGB 输出 (RINO)。绿诺建立在没有特定于任务的 微调 的通用图像编辑主干基础上,在分割和深度估计(我们将输出统一为 RGB)等密集理解任务和姿势到图像生成(我们将输入统一为 RGB)等密集条件生成任务上展示了强大且有竞争力的零样本性能。我们希望这项研究为通用的统一视觉语言系统提供有用的见解,在该系统中,可以通过共享的视觉语言来表达、解释和解决不同的视觉任务。代码可在 https://github.com/yangtiming/RINO 获取。