NeFut Logo NeFut
EN 管理员登录

[AI学术] 基于原子动作的音乐驱动舞蹈生成新框架

发布于:2026-07-17 22:00 最后更新:2026-07-18 08:19
#AI #Machine Learning #DeepSeek

摘要

音乐驱动的舞蹈生成旨在产生与音乐节奏同步且语义一致的人类动作。尽管最近的神经网络方法在视觉真实感上取得了显著进展,但它们通常将动作建模为连续信号,忽视了动作的组合性质,导致生成的舞蹈结构不连贯且难以控制。

在本研究中,我们提出了一种结构感知框架,将编舞视为一系列原子动作——这些是可语义解释的运动事件,作为舞蹈的构建模块。为了构建这一原子动作词汇,我们首先对大规模舞蹈数据进行分段,并将其聚类成原子动作组。接着,我们利用大型语言模型对聚类进行语义重新标记和细化,获得一组可解释且可重复使用的原子动作。

基于这些原子动作注释,我们设计了一个两阶段生成框架,镜像人类编舞过程。在原子动作规划阶段,模型根据输入音乐预测原子动作的类型、持续时间和时机,形成符号舞蹈分配。在完成阶段,过渡感知生成器根据规划的结构合成平滑且风格一致的动作。

大量实验表明,我们的方法在结构连贯性、节奏对齐和感知自然性方面显著优于现有基线,同时通过明确的结构表示提供了增强的可解释性和可控编辑能力。

博主点评: 本文提出的结构感知框架通过原子动作的概念,有效提升了舞蹈生成的可控性和自然感,展示了机器学习在艺术创作领域的广泛应用潜力。未来的研究可以进一步探索如何将更多复杂的舞蹈风格融入这一框架中。

原文链接: https://arxiv.org/abs/2607.13978

[h] 返回首页