传统巴塔克乌洛斯织造业因手工设计限制,难以产出多样创新的图案。本文提出一种多模态生成框架,将通过 LoRA 微调的 Stable Diffusion XL v1.0 与多模态大语言模型 LLaMA 1.5‑7B 结合,实现可控且符合文化传统的乌洛斯图案生成。
框架采用四种互补的条件机制:文本、图像、特征表示、语义地图(基于 ControlNet),分别控制语义意图、视觉风格、潜在特征以及空间布局。
在形状变换、颜色变化和高复杂度输入三类场景下进行五层消融实验,结果表明条件机制的数量并非越多越好。文本+图像+语义地图组合在 FID(270)和 CLIP Score(0.65‑0.70)上表现最佳,但 SSIM 仅 0.65;文本+图像+特征表示在 SSIM(0.84)和 FID(280)之间取得平衡;全部四种机制组合导致 FID 上升至 330,表明优化信号冲突。
随后邀请九位织工和三十名公众参与者进行定性评估,Wilcoxon 检验显示接受度显著提升(p=0.007),验证了框架的实用性。
点评