论文

instructionsCrafter:生成一致且高保真度的视觉指令

InstructionCrafter: Generating Consistent and High-Fidelity Visual Instructions

模型训练监督微调与指令调优

摘要

给定文本任务指令,生成分步视觉指令作为图像序列需要同时满足多个属性,特别是步骤 忠实性、跨图像一致性和每帧视觉质量。现有的文本到图像生成方法很少满足所有三个属性,因为独立采样会破坏一致性,对低质量视频的微调会降低每帧质量,以及缺乏多步骤理解的冻结主干网。在这项工作中,我们提出了InstructionCrafter,一种基于扩散的框架,其关键思想是通过(1)空间冻结训练和(2)指令感知适配器将时间和指令对齐的优化与每帧视觉质量分开。以预训练的视频扩散主干为基础,InstructionCrafter 冻结了控制每帧细节的空间层,仅更新时间和文本调节路径以学习指令语义和步骤间关系,从而保留了每帧质量的生成先验,并将可训练参数与完全微调相比减少了约 50%。我们还引入了两个轻量级适配器,可以增强模型对教学上下文的理解。一致适配器聚合来自整个指令序列和相邻步骤的文本线索,以保持跨帧的对象身份和属性一致,而上下文感知时间适配器将交叉注意输出转换为时间自注意的偏差,显式传播帧间关系。对两个基准数据集进行的大量实验证明了在步骤 忠实性、跨图像一致性和每帧视觉质量方面最先进的整体性能,同时显着减少了噪声、模糊和虚假字幕。我们的代码和经过训练的模型将公开。