论文

MACRO:利用结构化长上下文数据推进多参考图像生成

MACRO: Advancing Multi-Reference Image Generation with Structured Long-Context Data

应用与实践内容创作

摘要

生成基于多个视觉参考的图像对于现实世界的应用(例如多主题合成、叙事插图和新颖的视图合成)至关重要,但随着输入参考数量的增加,当前模型的性能会严重下降。我们将根本原因确定为基本数据瓶颈:现有数据集以单个或少数参考对为主,缺乏学习密集的相互参考依赖关系所需的结构化、长上下文监督。为了解决这个问题,我们引入了 MacroData,这是一个包含 40 万个样本的大型数据集,每个样本最多包含 10 个参考图像,系统地组织在四个互补维度(定制、插图、空间推理和时间动态)中,以提供多参考生成空间的全面覆盖。认识到同时缺乏标准化评估协议,我们进一步提出了 MacroBench,这是一个包含 4,000 个样本的基准,用于评估分级任务维度和输入规模之间的生成一致性。大量实验表明,MacroData 上的 微调 在多参考生成方面产生了实质性改进,消融研究进一步揭示了跨任务协同训练的协同效益和处理长上下文复杂性的有效策略。数据集和基准将公开发布。