在用户界面设计中,生成式工具通过将自然语言描述转化为完整的界面,承诺实现设计的民主化。这些工具不仅生成界面,还提供用户可见的设计理由,解释其布局、可访问性和设计选择。然而,尚不清楚这些陈述的理由是否真实反映在它们生成的界面中。我们称这种脱节为“设计剧场”:表面上合理且自信的设计理由与实际实现之间几乎没有关系。
为研究这一现象,我们引入了一个基准和三个度量标准来衡量设计剧场。该基准包含24个用户界面生成任务,涵盖结构、样式和功能设计要求。通过该基准,我们评估了五种生成式用户界面工具创建的120个界面。平均而言,超过25\%的用户可见设计理由未在生成的界面中实现,而功能需求的实施失败率更是高达34\%。这些工具大约识别了嵌入提示中的一半用户体验原则(平均值 = 0.54),而五种工具中有四种实现的功能原则不超过6\%。
我们还测量了不同工具之间的界面相似性,发现视觉外观和布局组织趋同,而颜色选择则存在更大差异。总体而言,我们的贡献包括:1) 提出设计剧场的概念;2) 提供一个基准和度量标准,用于评估生成式用户界面工具的陈述推理是否反映在其实现中;3) 系统评估这些工具的研究发现。我们讨论了这些发现对生成式用户界面工具的设计和评估的意义。
博主点评: 设计剧场这一概念揭示了生成式UI工具在实际应用中的局限性。尽管这些工具在理论上提供了便捷的设计选项,但其实现的有效性和可靠性仍需大幅提升,以确保设计理由与最终界面的一致性。未来的研究应集中在如何提升工具的功能实现能力上。