论文

Moonworks Lunara:塑造艺术智慧

Moonworks Lunara: Modeling Artistic Intelligence

模型训练预训练

摘要

我们将 \emph{艺术智能} 表述为探索驱动的世界实现,为创造性可能性留出空间,同时保留必须保持真实的语义、艺术和构图结构。 Moonworks Lunara 是一种文本到图像模型,通过新颖的 Diffusion Mixture Transformer 架构实现了该框架。一种新的训练算法通过信息样本采集和有针对性地注入人类创造的艺术来迭代地发展数据分布。我们将 Lunara 与 7 个图像生成模型进行基准测试,包括 FLUX.2-Klein-4B、Qwen-Image (20B) 和 GPT-Image-1-Mini。使用 GPT-5.6 Sol 作为评估器,Lunara 在 \emph{美学质量(8.473 与 8.457 GPT-Image-1-mini)} 中排名第一,在 \emph{情感共鸣} 中排名第二,并且在 \emph{内容完整性} 中保持竞争力。对同一评估集进行的盲人评估证实了自动化指标,将 Lunara 排名第一。在包括 CLIPScore 和 LAION Aesthetic Predictor 在内的传统衡量标准下,它仍然是最强的模型之一。在 GenEval 上,Lunara 与更广泛的 16 个模型(包括 GPT Image 2 和 Seedream 4.0)相比,取得了具有竞争力的性能。这些结果使 Lunara 处于艺术智能的前沿,同时保持了低于 10B 的活动参数占用空间和低于 10 秒的推理延迟。 Lunara 通过将问题从模型能否正确获取图像转移到模型能够多深入地解释意义并将其实现为富有想象力和表现力的世界,从而推进了通用视觉智能的前沿。