论文
多模态条件控制下的SDXL微调:兼顾可控性与文化忠实性的Ulos纹样生成
Multimodal Conditioning of Fine-Tuned Stable Diffusion XL for Controllable and Culturally Faithful Ulos Motif Generation
摘要
传统巴塔克Ulos织造业因常规人工设计方式限制,在多样创新纹样生产上面临挑战。本研究提出多模态生成框架,整合经LoRA微调的潜在扩散模型Stable Diffusion XL v1.0与多模态大语言模型LLaMA 1.5-7B,实现可控且忠于文化的Ulos纹样生成。文本、图像、表征和通过ControlNet输入的语义图四种互补条件共同引导生成,分别控制从语义意图到空间布局的不同方面。在形状变换、颜色变化和高复杂输入三类场景的五级消融中,条件效果不与组合数量成正比:文本加图像加语义图获得最佳FID 270和CLIP分数0.65—0.70,却有最弱SSIM 0.65;文本加图像加表征整体最均衡,SSIM稳定为0.84,FID为有竞争力的280。四种机制全组合的FID最差,为330,显示优化信号冲突。九位织工和三十位公众参与者的定性评估确认统计显著的积极接受,Wilcoxon检验p分别为0.007和小于0.001。研究还开发支持文生图与图生图的网页原型,为文化遗产保护提供实用数字设计工具。