FireRed-Image-Edit 1.0 首发并在 ImgEdit、GEdit 等榜单取得 SOTA,同时提出 RedEdit Bench 评测集
小红书发布FireRed-Image-Edit:图像编辑新SOTA
概述
模型正式亮相 GitHub,在复杂编辑指令、风格化转换及高精度文字编辑方面表现突出,并在 ImgEdit、GEdit 等多个榜单取得 SOTA。针对现有基准无法满足用户复杂需求的问题,团队同时提出含 15 个子任务的 RedEdit Bench,除常规增删改外纳入人像美化、低画质增强等高频实战场景,对比实验表明该 Bench 对编辑模型通用能力的评估精度优于 ImgEdit 与 GEdit,并预告随后开源。能力侧重点包括指令遵循一致性(随机指令打乱重组使模型真正理解语义与图像对应关系)、Layout-Aware OCR-based Reward(RL 阶段同时惩罚错别字与字符错位/大小异常/布局崩坏)、创意与多图生成,以及把超分、去模糊、去噪与光影增强统一纳入指令微调的一键画质修复。当前代码、技术报告与 demo 网页已开源,模型权重「即将在未来几天开源」。 数据侧构建一套从「快速、可控、精准」出发的生产引擎:把复杂编辑需求拆解为可组合子任务,通过指令控制的专家模型合成、结构化控制(分割/关键点/深度等)的专家模型合成、模型无关模板化合成(3D/布局/文字)三条路径规模化产出训练数据;针对长尾样本稀缺采用「检查—补齐」定向补数流程,由引擎快速生成针对性数据,并配三层级去重、十余种质量清洗算子与严格一致性守门员,确保指令遵循、视觉自然度与内容一致性。训练侧分三阶段:预训练用多条件感知桶采样平衡不同编辑任务、随机动态指令提升指令泛化理解、前置 embedding 抽取提升效率;微调引入高质量数据;强化学习阶段通过非对称梯度优化强化正样本反馈,并用基于 OCR 奖励的 diffusionNFT 提升文字编辑准确性。