论文

用于保留结构的漫画图像编辑的推理时间轨迹优化

Inference-time Trajectory Optimization for Structure-Preserving Manga Image Editing

模型推理解码与生成控制

摘要

我们提出了一种轻量级的 无需训练 轨迹校正方法,该方法仅使用输入本身将预训练的图像编辑模型适应每个输入漫画图像。尽管最近在预训练图像编辑方面取得了进展,但此类模型在漫画上的表现通常不佳,因为它们主要是在自然图像数据上进行训练的,而在漫画上重新训练或 微调 成本高昂,并且会引发版权问题。实践中遇到的许多漫画图像编辑任务都是结构保留的,需要修改局部细节,同时保留输入的全局组成。为了支持这种常见的编辑设置,我们的方法通过将其锚定到空提示重建轨迹来纠正早期编辑轨迹。实验表明,主要文本删除设置中的性能得到了改善,而定性示例表明,在屏幕色调合成中,构图得到了更好的保留。在 RTX A6000 上使用 FLUX.1 Kontext 时,该方法会产生 11% 的运行时开销和 0.1% 的峰值内存开销;在 NVIDIA H200 上使用 Qwen Image Edit 2509 进行的额外运行时间测量显示仅增加了 0.1%。