摘要
现有的符号音乐生成模型通常以小节作为基本结构单元。然而,人类对音乐短语的感知往往与标记的小节线不一致,导致长期结构的碎片化。本文提出了RPPNet——一种具有可变结构边界的两阶段深度学习架构。
方法
- 生成可变长度的节奏-音高原语(RPP)序列:每个RPP编码了音符数量、节奏和轮廓。
- 解码RPP序列为具体音符:通过自动从声学线索、听觉惯性和基于音乐心理学的相似性感知中推导RPP的分组。
实验结果
实验表明,RPPNet生成的旋律在长期结构和音乐性方面表现优越,在所有主观评估维度上都有显著改善。消融研究确认,性能提升源于心理表示的结构正确性,而非模型能力的提升。
结论
这项工作为音乐生成提供了跨学科的视角,结合了音乐理论、计算建模和音乐心理学。
博主点评: RPPNet的创新之处在于通过感知分组的方式提升了音乐生成的结构性,突破了传统模型在小节划分上的局限,展现了深度学习与音乐心理学结合的潜力。其方法论值得在其他领域进行借鉴与应用。