论文

接下来要编辑什么:对话系统中视觉对齐的图像编辑后续建议

What to Edit Next: Visually Aligned Image-Editing Follow-Up Suggestions in Conversational Systems

模型训练强化学习

摘要

会话助理越来越多地推荐后续编辑以帮助用户继续执行任务。现有系统主要针对纯文本交互,而图像创建对话尚未得到充分探索。在图像创建任务中,有用的后续编辑建议必须反映用户偏好,提供不同的方向,并在当前图像上保持可执行。我们从 Qwen App 中收集了 10 万个真实的多轮图像创建对话样本,发现其中 80.1% 是图像相关的,这凸显了多模态推荐的必要性。我们通过一个三阶段框架来解决这个问题。在第一阶段,我们使用真实的在线数据来构建一个经过人工审查的适当后续编辑意图表,然后创建 SFT 目标并微调多模式策略。在第二阶段,为了使规则引导的 SFT 建议与实际用户选择保持一致,我们使用用户点击反馈通过多目标强化学习来优化策略。在第三阶段,为了减少建议编辑和当前图像之间的视觉不一致,我们引入了视觉验证器作为额外的训练监督。大量的实验表明,我们的框架在自动评估和人工评估方面都显着优于基线。在对数百万用户进行的实时用户随机 A/B 测试中,我们的最终框架将视觉不一致性从 3.7% 减少到 0.9%。此外,它还显着提高了推荐点击率 32.70%,图片获取率提高了 16.32%,每个用户的平均会话次数提高了 39.90%(均 p<0.05)。项目页面:https://what-to-edit-next.github.io/