ECCV 2026|北大团队提出Atomic Dance:基于原子动作的可解释音乐舞蹈生成框架
该论文的第一作者和通讯作者均来自北京大学王选计算机研究所,第一作者为博士生蔡鑫豪,通讯作者为博士生导师刘洋。团队近年来在 TPAMI、IJCV、CVPR、ICML 等顶会上有多项代表性成果发表,多次荣获国内外多模态理解与生成竞赛冠军,和国内外知名高校、科研机构广泛开展合作。
本文主要介绍来自该团队的最新论文 Music-to-Dance Generation via Atomic Movements。
该工作聚焦于音乐驱动舞蹈生成任务,首次提出以原子动作作为舞蹈的基本组成单元,建立了具有明确语义和结构的舞蹈表示,并设计了 "动作规划 — 舞蹈生成" 两阶段框架,使生成的舞蹈不仅更加符合音乐节奏和整体编舞逻辑,还具备良好的可解释性和可编辑性,为智能编舞提供了新的研究思路。
目前该工作已被 ECCV 2026 正式接收,相关代码与模型已全部开源。
论文标题:Music-to-Dance Generation via Atomic Movements
论文链接:https://arxiv.org/abs/2607.13978
代码链接:https://github.com/oceanflowlab/AtomicDance
项目主页:https://cxhcmhhh.github.io/AtomicDanceProject/
为什么 AI 能跳舞,却不会编舞?
近年来,扩散模型的发展推动了音乐驱动舞蹈生成取得快速进展。输入一段音乐,模型即可生成对应的三维人体舞蹈动作。然而,如果仔细观察真实舞蹈,会发现舞蹈并不是连续动作的简单拼接,而具有明显的结构性。无论是街舞、爵士还是现代舞,一段完整的舞蹈通常都会围绕若干具有明确意义的动作不断展开:某个挥臂动作可能随着不同音乐节拍多次重复;某个转身动作可能不断变化速度、幅度和方向;多个基础动作按照一定顺序不断组合,共同形成完整编舞。
然而,现有主流方法大多将音乐到舞蹈生成视为端到端序列生成问题,直接预测每一帧人体姿态。虽然这种方式能够学习局部节奏对应关系,但无法理解舞蹈背后的结构组织,因此容易导致长时间舞蹈缺乏整体一致性、动作不断重复却缺少变化、很难理解模型为什么会生成某个动作、用户几乎无法编辑已经生成的舞蹈等问题。
因此,AI 是不是应该先学会 "编舞",再学会 "跳舞"?这一问题成为本文工作的出发点。
把舞蹈拆解成 "原子动作"
为此,研究团队提出了一个新的概念 ——Atomic Movement(原子动作)。团队认为,一个真正能够作为编舞基本单元的动作,应满足三个特点:
(1)完整的 动作 过程,而不是单一姿态。 例如,一个踢腿动作不仅包含抬腿瞬间,还包括准备、发力和收腿整个过程,因此能够表达完整动作含义。
(2)能够不断重复,但每次又有所变化。 同一个动作可以随着音乐变化速度、方向、幅度和力度,在整支舞蹈中不断重复出现。
(3)具有明确语义。 每个动作都能够被自然语言描述,例如 "举起右手"" 双臂展开 ""身体旋转" 等,使动作能够被理解、检索和编辑。