最近,AI音乐生成的进展使得用户可以根据自然语言提示创作完整的音乐作品。然而,大多数现有系统采用提示-再生成的范式,导致用户在迭代改进时必须重复创建作品,而非直接演进已有的音乐想法。
我们提出了MusiChat,一个支持人机协作音乐创作的对话式氛围编曲系统,通过自然语言交互和迭代改进实现。
MusiChat的核心是一个分层可控的音乐生成框架,它将歌词对齐的音乐结构生成与表现层的实现分开,从而允许灵活的风格转换和结构保留的编辑。
该系统通过增强记忆的架构整合了大型语言模型与混合符号音乐引擎,维护了活跃的创作状态和用户历史。
一个混合意图路由机制进一步提高了对精确音乐编辑和开放式创意请求的高效解释。MusiChat不是从头再生成作品,而是逐步转化正在演变的音乐作品,同时保留相关的音乐结构和用户意图。
我们通过客观分析和人类研究对MusiChat进行了评估,实现了单轮和多轮交互的准确率分别为95.31%和100%,并获得旋律自然性和音乐质量的喜爱比率分别为2:1和3:1。
我们的结果表明,MusiChat支持连贯的多轮音乐创作和通过对话界面进行的互动人机共创。
博主点评: MusiChat通过引入对话式交互和分层控制,显著提升了音乐创作的灵活性与用户体验。这一系统不仅解决了传统生成模型的迭代不足问题,还通过记忆机制保持用户意图的连贯性,展示了AI在艺术创作领域的巨大潜力。其高达100%的准确率也表明了其在音乐生成任务中的有效性。