在协同创作中,人类对齐的人工智能是一个关键组成部分,它使模型能够准确解读人类意图,并生成与设计目标相符的可控输出,从而支持内容创作。程序化内容生成通过强化学习(PCGRL)尤其相关,旨在为人类设计师提供工具。
然而,现有系统往往未能展现以人为本的行为,限制了AI驱动生成工具在现实设计工作流程中的实用性。本文提出了一种新颖的深度强化学习框架VIPCGRL(Vision-Instruction PCGRL),它结合了文本、关卡和草图三种模态,以扩展控制模态并增强人类相似性。
我们引入了一个通过四元对比学习训练的共享嵌入空间,跨模态和人机风格进行对齐,并使用基于嵌入相似性的辅助奖励来调整策略。实验结果表明,VIPCGRL在与人类相似性方面超越了现有基线,得到了定量指标和人类评估的验证。代码和数据集可在 GitHub 获取。
博主点评: 本文提出的VIPCGRL框架通过多模态学习有效提升了程序化内容生成的质量,尤其在增强人类对齐方面表现突出。这种方法为未来的协同创作工具提供了新的思路,值得关注和深入研究。