论文
当场景文本劫持场景时:发现、利用和减轻图像生成模型中的渲染文本语义泄漏
When Scene Text Hijacks the Scene: Uncovering, Exploiting, and Mitigating Rendered-Text Semantic Leakage in Image Generation Models
摘要
图像生成模型 (IGM) 的可靠性和可解释性对于构建负责任且值得信赖的人工智能系统至关重要。最近的 IGM,例如 Nano Banana 和 GPT-Image,现在支持复杂的指令跟踪、逼真的图像合成和可控的场景文本渲染。随着这些功能的扩展,安全分析还必须考虑复杂提示引入的新控制通道。在这项工作中,我们研究了渲染文本语义泄漏,这是开放域文本渲染中很大程度上被忽视的现象。尽管渲染的文本旨在充当应在生成的图像中逐字再现的局部视觉约束,但它还携带可以由模型解释为输入指令的一部分的语言语义。这使得渲染的文本成为潜在的语义控制通道,其安全影响仍未得到充分理解。我们通过将主要视觉提示与渲染文本解耦并测量它们对生成图像的个体和组合效果来系统地表征这种现象。我们量化语义 泄漏和渲染保真度,并进一步分析泄漏是如何从中间模型证据中出现的。然后,我们表明,即使主要视觉提示保持良性,场景文本中嵌入的有害语义也可以通过基于 LLM 的提示增强管道持续存在并引导非文本图像区域。最后,我们提出了一种初步的缓解方法,可以减少从渲染文本到非文本区域的不安全语义转移,同时保留 FLUX-2-dev 上预期的文本渲染行为。我们的研究结果揭示了渲染文本作为可见数据和潜在语义的双重用途载体,暴露了现代 IGM 中以文本为中心的跨模式攻击面。