论文

CRAFT:通过注意力 微调 进行受限奖励,用于没有组合目标的主题个性化

CRAFT: Constrained Reward via Attention Fine-Tuning for Subject Personalization without Composed Targets

模型训练强化学习

摘要

主题驱动的图像个性化——生成新图像,保留新颖场景中一个或多个参考主题的身份——是现代视觉内容创作的一项基本能力。目前,它以通用方法为主,这些方法在数十万到数百万个配对的 \emph{(reference,composed-target)} 示例上微调预训练的多模态扩散 Transformer (MMDiT),其中每个组合目标都是新颖场景中主题的合成图像。生成此类目标需要昂贵的多阶段管理流程——基于 LLM 的提示生成、基于 T2I 的组合目标合成、参考主题提取、基于 VLM 的质量过滤和对应标记——并将每种方法与特定的目标合成器和管理选择紧密耦合。我们引入了 \emph{CRAFT} (通过注意力 微调 进行约束奖励),这是一个单步 ReFL 框架,它通过 LoRA 适配器使用紧凑的仅供参考的数据结构微调预训练的 \emph{reference-aware} MMDiT — $10$K 参考图像和主题蒙版,没有组合目标监督。 CRAFT 实现了 \emph{看哪里} 原则:注意力级别奖励将噪声和短语标记注意力与正确的参考主题对齐,并且生成的每个主题注意力​​掩模门控像素级身份奖励,以保持图像空间监督与学习的注意力路由一致。应用于 FLUX.2-klein-9B 时,CRAFT 在 XVerseBench \rev 上实现了最先进的性能{同时不使用组合目标监督——仅使用 $10$K 仅供参考的样本,而先前的广义方法需要 $150$K 到超过 $2$M 组合目标对}。相同的方法可以转移到其他参考感知骨干网,从而持续提高性能。项目页面:https://jihun999.github.io/projects/CRAFT/。