论文
ProductWebGen:多模式产品网页生成基准测试
ProductWebGen: Benchmarking Multimodal Product Webpage Generation
摘要
根据源产品图像以及布局和视觉内容说明制作产品展示网页,对于营销、广告和电子商务等领域具有重要的实用价值。直观上,此任务需要产品显示之间严格的视觉一致性以及遵循高保真指令以共同生成可渲染的 HTML 代码。这些对可控性和指令遵循的要求与高级多模态生成模型的核心特征紧密结合,例如图像编辑模型和统一模型。为此,本文引入ProductWebGen来系统地对这些模型的产品网页生成能力进行基准测试。我们组织了ProductWebGen,包含13个产品类别的500个测试样本;每个样本由源图像、视觉内容指令和网页指令组成。任务是根据源图像和指令生成包含多个一致图像的产品展示网页。考虑到任务的混合模态输入输出性质,我们设计并系统地比较了两种评估工作流程——一种使用 大语言模型 和图像编辑模型分别生成 HTML 代码和图像(基于编辑),而另一种依赖单个 UM 来生成两者,图像生成以前面的多模态上下文为条件(基于 UM)。实证结果表明,基于编辑的方法在网页指令跟随和内容吸引力方面取得了领先的结果,而基于UM的方法在完成视觉内容指令方面可能表现出更多优势。我们还构建了一个有监督的 微调 数据集 ProductWebGen-1k,其中包含 1,000 组真实产品图像和 LLM 生成的 HTML 代码。我们在开源 UM BAGEL 上验证了其有效性。数据和代码可在 https://github.com/SJTU-DENG-Lab/ProductWebGen 获取。