论文
Visual Jev奖励:为多主体图像生成验证参考身份与关系
Visual Jev Rewards: Reference-Bound Verification for Multi-Subject Image Generation
摘要
多主体图像生成需要奖励来验证所请求的属性、动作和关系是否适用于指定的参考主体。受试者的存在本身并不能确定正确的受试者参与了所请求的交互。我们提出了参考约束的 Visual Jev 奖励,将这些视觉决策转化为生成器训练信号。仅当所请求的条件和相关参考身份共同存在时,每个与主题相关的问题才会获得肯定标签。我们离线构建固定问题,训练具有二元监督的 Qwen3.5-4B 验证器,并直接从其语言模型头部读取“是”概率。他们的平均值提供了 GRPO 奖励,同时保留个人判断以供检查。使用 200 个 MICo-150K 训练任务和 30 次更新,该框架在手动选择的 897 个任务 MICo-Bench 子集上将 GPT-5.4 综合得分从 41.78 提高到 52.50;直接27B奖励收益率51.84。每个奖励都在一次 GRPO 运行中进行测试,离线人工评估并没有比直接评分具有统计上显着的优势。该研究提供了 Visual Jev 的初步实施和评估,作为多主体图像生成的参考绑定奖励。