论文
ExpertVerse:知识密集型视觉生成的专家推理基准
ExpertVerse: A General-Purpose Benchmark for Expert-Level Reasoning in Knowledge-Intensive Visual Synthesis
摘要
多模态生成模型推动指令图像生成从语义修改向知识驱动视觉推理发展,但现有方法多关注常识、浅层因果与直接知识回忆,难以处理知识密集型生成。ExpertVerse 以能力为中心,用九种认知能力与八个专家领域的正交分类,覆盖 58 个子领域,整理 1611 个专家标注样本,涵盖单图编辑、多图组合和文生图。自动流程进一步生成带推理轨迹与知识依据解释的 ExpertVerse-100K。研究以强化学习微调训练 KnowThinker,让具有世界知识的视觉语言推理模型同时生成思考过程与改进指令。针对多奖励优化的跨模态信用分配错位和梯度冲突,提出自举帕累托策略优化 BPPO,结合自举奖励修正 BRR 与冲突感知帕累托优势融合 CPAF。开源与专有模型评测揭示了关键推理不足,说明下一代视觉生成需要知识密集型基准。