论文
超越文本提示:视觉到视觉生成作为统一范式
Beyond Text Prompts: Visual-to-Visual Generation as A Unified Paradigm
摘要
人类经常通过视觉制品来指定和创造:排版表、草图、参考图像和带注释的场景。然而,现代视觉生成器仍然要求用户将这种意图序列化为文本,这是压缩空间结构、精确外观和字形形状等信号的瓶颈。我们提出 \textbf{\emph{视觉到视觉} (V2V)} 生成,其中用户使用视觉规范页面而不是文本提示来调节生成模型。该页面不是编辑目标,而是指定所需输出的可视文档。我们引入了 \textbf{V2V-Zero},这是一个 无需训练 框架,它通过用从视觉页面提取的最终层隐藏状态替换仅文本条件,从而在现有视觉语言模型(VLM)条件生成器中公开此接口,利用冻结的 VLM 已经将文本和图像映射到生成器条件空间的事实。在 GenEval 上,V2V-Zero 在冻结 Qwen-Image 主干的情况下达到 0.85,与没有 微调 的优化文本到图像性能非常匹配。为了评估更广泛的 V2V 空间,我们引入了 \textbf{Simple-V2V Bench},涵盖七个视觉调节任务和七个模型,包括 GPT Image 2、Nano Banana 2、Seedream 5.0 Lite、开放权重基线和视频扩展。 V2V-Zero 得分为 32.7/100,优于评估的开放权重图像基线,并揭示了清晰的能力层次结构:属性绑定很强,内容生成不可靠,即使对于商业系统,结构控制仍然很困难。 HunyuanVideo-1.5 扩展得分为 20.2/100,显示界面传输超出了图像范围。机制分析显示默认推理路径主要是视觉路由,95.0% 的条件词元注意力集中在视觉页面隐藏状态上。