论文
RankE:通过解码器协同进化实现离散文本到图像生成的端到端 后训练
RankE: End-to-End Post-Training for Discrete Text-to-Image Generation with Decoder Co-Evolution
摘要
离散自回归 (AR) 文本到图像 (T2I) 模型将 VQ 分词器与 AR 策略配对,当前的 后训练 管道仅优化策略,同时保持 VQ 解码器冻结。最近的扩散 T2I 工作(以 REPA-E 为代表)表明,VAE 本身构成了关键的对齐瓶颈,但对于离散 AR 模型还没有类似的研究。我们表明,仅策略优化会引起潜在协变量转变:随着策略的发展,生成的词元分布与解码器训练所用的 真值 分布不同,因此奖励分数提高,而解码图像质量下降。为了解决这种不匹配问题,我们提出了 RankE,这是第一个用于离散 T2I 生成的端到端 后训练 框架。 RankE 不是针对固定解码器优化策略,而是通过交替优化来共同进化两个组件:每个模块最大化基于排名的对齐目标,同时通过适合其参数空间的稳定性保持锚进行正则化。这种共同进化打破了困扰冻结解码器方法的保真度与对齐权衡:在 LlamaGen-XL (775M) 上,标准 RL 改进了 CLIP,但降低了 FID,而 RankE 同时改进了两者(MS-COCO 30K 上的 FID 15.21,CLIP 33.76)。 Janus-Pro (1B) 上的一致增益证实解码器共同进化可靠地将奖励优化转化为像素空间质量改进。